AgentWorld 基准评测多智能体协作:最强模型团队仅完成 52.0% 任务
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。
阿里巴巴高级技术专家孙鹏将在 QCon 上海 2026 分享 BoRP(Bootstrapped Regression Probing)评测范式,不再让模型写评语,而是直接读取 LLM 隐状态中的满意度信号,评测成本降低 97%,人类对齐度超过传统生成式 Judge。该方案在 8B 模型上对齐 GPT-4 级评测精度,成本约为其 3%,已在万亿级流量的 A/B 测试中落地。
研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。
Mercor VP Chirag Mahapatra 在 Assembling 2026 上表示,前沿实验室在科学、材料科学、生物等复杂领域只收集到构建极高质量模型所需数据的 1% 到 2%,物理世界数据同样如此,整体可能只到 2% 到 5%。
作者仅提供一个提示词和论文页面 URL,就让 Opus 5.5 把 OpenAI 的 722 篇 AI 数学论文浓缩成一段 92 秒的动态图形解说视频。它展示的是单一提示词加链接输入下,模型对大规模论文集合做压缩并生成动态解说内容的效果。
Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。
Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。
Agent Arena 采用因果追踪(causal tracing)方法衡量智能体能力,替代成对偏好投票,从真实、长时程的智能体会话中提取五项信号。
Ideogram 4.5 在 Artificial Analysis 的 30 轮连续编辑测试中保持了原图稳定,而 GPT Image 2.5 Sunburst 出现明显漂移。
GPT-5.5 在 KernelBench-Verified 修正后的整体几何平均加速比从 1.43× 降到 0.88×,原因是基线补上了 TF32 和隐藏输入分布。
2026 年 9 月 GitHub 十大热门项目榜单从约 23 个候选中选出 ponytail、ECC、open-code-review、hindsight、WeKnora、cua 等十个项目,覆盖编码 Skill、Agent Harness、代码评审、Agent Memory、知识 RAG 与 Computer-Use 等方向。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。
Surge 发布 sudo L7 新基准,用于衡量 AI 距离 staff 级软件工程师的水平——结论是"我们走了一半"。该基准含 60 个任务,多数来自真实公司的私有生产仓库,由真正负责过这些系统的工程师编写,评分维度涵盖功能正确性、工程手艺、架构判断、协作与冗余复杂度。表现最好的智能体仅能成功完成约 45% 的任务,coding agent 仍停留在 L3 水平。
Sonnet 5.5 在与 Asta 和 Sol 的对比中胜出,这一结果被评价为"wild"。原文未披露具体评测项目、分数或对比条件,仅提及该表现令人意外。
LangSmith Signals 上月数据显示,Claude Sonnet 5 在模型采用率上从第 9 升至第 2,使用它的组织数量增加 51%;gpt 5.6 luna 在调用足迹上从第 3 升至第 1,调用量增加 65%。两个开源权重模型进入采用率前 10,但调用量未进前列,更小更快的模型主导调用足迹。
Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。
Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
Arena.ai 推出 Arena Alignment Index,这是一个衡量 AI 智能体在真实使用中安全与对齐表现的基准,数据来自 27 个模型的 90K+ 真实智能体会话。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
AI模型评测平台Arena宣布完成2亿美元B轮融资,估值达31亿美元,本轮由Lightspeed Venture Partners和Khosla Ventures领投,Salesforce Ventures、a16z、Felicis等跟投。
联想天禧 AI 自研的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一,并通过官方 Verified 核验。TianxiCode 具备跨文件多跳检索、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大能力,未来将落地联想 AI 硬件产品。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
Snyk 将其内部支持 Agent 转为客户功能 Snyk Assist,一个基于 LangChain 和 LangGraph 构建、在 LangSmith 中管理可观测性的对话式 Agent,可查询未解决问题、检查软件包漏洞、创建支持工单或记录功能请求。
Jerry Liu 提出"eval 驱动开发":如今只要定义一个 eval 并对它爬山优化,就能解决几乎任何任务,而不必直接编写确定性的智能体工作流。他认为数据提供方的工作就是为各类经济活动定义 eval,让前沿模型具备完成任何事的能力,开发者则负责指明方向、定义要解决什么以及如何衡量好结果。最复杂的流程仍需显式工作流构建界面,但多数任务可压缩为目标加 eval 指令。
Harrison Chase 指出,eval 驱动开发对范围狭窄的任务有效,但对更自主的 AI 智能体并不适用,因为古德哈特定律下指标一旦成为目标就不再是好指标。Hunter Gerlach 提出应对路径:持续创建高价值 eval,同时对抗古德哈特定律,再回到第一步循环。
LangSmith 评测中的 Jev 判官把轨迹标注拆成多个问题,难度和正确性各自得到带类型的答案,且在一次 pass 中、对每条 trace 完成。该框架认为轨迹标注需覆盖任务难度、方案正确性、设计选择多样性和思考方向等维度,规模化标注百万级 agent 及其子 agent 的 token 成本仍待大幅降低。
70 位 AI 从业者对全球主要实验室划分梯队,只有 Anthropic 和 OpenAI 获得 Frontier 共识,即至少 75% 受访者将二者选入同一档。
Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
will depue 让 GPT 6 Pro 和 Fable 5.1 对近三年所有发现按人类发现、AI 发现及 OpenAI/math 仓库 AI 发现(10 月 6 日前)三色标注排序,其中 81% 已于今日发布。
Notion AI 负责人 Sarah Sachs 将在 Forge 大会上分享为何团队应构建自己的评测体系,而不是依赖榜单来判断新模型和智能体是否适合自己的产品。她认为模型与智能体每周都在迭代,只有自建评测才能验证其实际效果。活动于 11 月 3 日在旧金山举行,需申请报名。
OpenRouter 上线 Decision Model Rankings,可查看不同决策模型和任务类型的支出份额与 token 份额,覆盖 Relevance、Correctness、Instruction Following 等类别,目前 typesafeai 在所有类别中领先。
在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。
GPT-6 Luna 成为当前最快的 Decisions 模型,全球请求延迟为 180ms。Jev 和 Perplexity Decider 位列其后。
Anthropic 的 Haiku 5.5 定价专门针对中国竞品,价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash;在 Terminal Bench 4.0 上,AA 测试比 GLM 5.3 flash 高一分,也与其他两个竞品持平或更高。歸藏批评此举“恶心”,并质疑外界因降价而淡忘 Anthropic 过往行为。
Smallest AI 的 Pulse 在 Voice Arena Diarization Bench 的 Diarization + ASR 赛道以 24.4% DER 排名第一,在 0 ms collar 的严格设置下,误差比第二名 ElevenLabs Scribe v2 的 40.7% 低 1.7 倍。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
爱范儿作者在 RTX 5080 上实测 DLSS 5 正式版,在《NBA 2K27》中开启后球员皮肤、球衣织物、地板木纹与整体光影更接近真实比赛质感。