AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。
Meta Superintelligence Labs 提出用「agent plasticity」衡量自我改进智能体的学习性价比,即在模型权重冻结、每次运行从全新上下文开始的前提下,held-out 任务上的收益除以学习花费。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。
Surge 发布 sudo L7 新基准,用于衡量 AI 距离 staff 级软件工程师的水平——结论是"我们走了一半"。该基准含 60 个任务,多数来自真实公司的私有生产仓库,由真正负责过这些系统的工程师编写,评分维度涵盖功能正确性、工程手艺、架构判断、协作与冗余复杂度。表现最好的智能体仅能成功完成约 45% 的任务,coding agent 仍停留在 L3 水平。
Arena.ai 推出 Arena Alignment Index,这是一个衡量 AI 智能体在真实使用中安全与对齐表现的基准,数据来自 27 个模型的 90K+ 真实智能体会话。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
Arena.ai 发布 Arena Alignment Index,一个衡量 AI 智能体真实使用中安全与对齐表现的新基准,基于 27 个模型的 90K+ 真实智能体会话构建,衡量未授权操作(UA)、错误归因(FA)和虚假完成(DC)三类信号。
LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。
一篇题为《Old Ideas, Novel Problems》的论文研究基于 LLM 的新颖性评估的不稳定性,论文已在 Hugging Face 上线。该研究聚焦 LLM 用于评判研究新颖性时结果是否稳定可靠。
Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。
UniPat AI 推出 PaperBenchX(PBX)评测,让 AI 在真实科学软件中复现已发表论文的关键实验。在覆盖 12 个科学方向的 93 道题中,70 道没有被任何配置完全复现,表现最好的 GPT-6 Astra 仅有 14% 的任务过关,国产模型基本在 7% 左右。评测发现建模和执行平均得分都在六成以上,但科学验证仅约 43%,多轮交互难以弥补这一差距。
在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。
Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。
Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。
Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
Cohere 提出 RCP-nDCG@10,替代传统 nDCG 只给答案键内结果记分的做法,对每条结果按其真实相关性打分。该指标结果由人工审核员与 MTEB 背书。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。
mem0 发布 DolphinBench,用于评测长历史之后的智能体行动,并将准确率、成本与延迟放在同一张榜上。现有公开基准多把记忆当作问答测验,只看答案对错和 precision、recall,忽略了选型时真正关心的成本与延迟。DolphinBench 认为关键事实往往不在请求里,而要靠工具调用体现。
腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。
HyperFrames 联合 Google DeepMind 和 Kaggle 推出 Code2Video Bench,用于衡量模型生成的代码能否渲染成值得观看的视频。该基准指出,SWE-bench 意义上的代码能力与"代码转视频"是两回事,目标是让前沿实验室在智能体视频任务上取得进展。
腾讯混元联合清华、北大提出网页生成评测基准 WebCraftBench,把软件测试方法引入评测:用智能体真实操作网页,结合代码覆盖率与美观度、易用性、需求符合度三维打分。基准含 369 条真实需求、5,088 条验收标准,覆盖 17 个前沿模型生成的 6,273 个应用,在 197 组人类偏好对比中一致率达 85.3%。
腾讯混元推出 EvolveScaler,把世界定义为可执行状态机再渲染成自然语言,模拟记录被撤回、更正、回填的"信息演化"。该基准含 117 个原型、159 个问题算子、5 个难度层级,单样本事件量最高约 1,200。14 个前沿模型在最难层级上 avg@5 中位数降至 11.3,而用它训练可在 8 个分布外基准上平均提升 5.25。
NeoCognition 发布 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。其称 Fable 5.1 和 GPT-6 Astra 已能在岗位上持续学习并超越人类专业人士,且无需 FDE,智能体可自行部署到工作中。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。