热点事件持续更新
AgentWorld 多智能体协作评测基准发布
2 篇报道2 个报道来源9 小时前更新
先了解这件事
AI 综述
2026年10月10日,新智元报道 OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建了多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体,报道称最强模型团队仅完成 52.0% 的任务。同日,InfoQ 中文报道该基准让 LLM 驱动的智能体在 MMORPG 沙盒环境中分工完成制作、采集、战斗等长时程任务,称最强模型也只完成约一半任务。目前该基准已对外发布,具体任务设置与完整评测结果有待更多细节披露。
AI 根据报道生成 · 4 小时前更新
最新进展10月10日 13:39
新智元报道称最强模型团队在 AgentWorld 中仅完成 52.0% 的任务。报道时间线
沿着报道,了解事件的不同侧面。
10月10日
- InfoQ 中文让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?
研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。
- 新智元AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
本事件热度走势
当前热度 15·可比范围峰值 16(10月10日 19:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。