跳到正文
热点事件持续更新

AgentWorld 多智能体协作评测基准发布

2 篇报道2 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年10月10日,新智元报道 OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建了多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体,报道称最强模型团队仅完成 52.0% 的任务。同日,InfoQ 中文报道该基准让 LLM 驱动的智能体在 MMORPG 沙盒环境中分工完成制作、采集、战斗等长时程任务,称最强模型也只完成约一半任务。目前该基准已对外发布,具体任务设置与完整评测结果有待更多细节披露。

AI 根据报道生成 · 4 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. InfoQ 中文
    让 AI 组队干活,最强模型也只完成约一半任务:AgentWorld 如何评测 Agent 协作能力?

    研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。

  2. 新智元
    AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务

    OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。

本事件热度走势

当前热度 15·可比范围峰值 16(10月10日 19:00)·近 24 小时可比范围变化 –

0510152010月10日19:0010月10日20:0010月10日21:0010月10日22:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。