美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。
Every 已构建个人基准测试平台 Checks,帮助任何人衡量新模型在其实际工作中的表现,目前正招聘产品经理。该岗位面向理解这一方向重要性、并希望参与塑造人类借助 AI 完成工作方式的人。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。
Jev Router 最常用的 5 个模型中 4 个位于帕累托前沿,可操控性表现突出,但整体权衡不及直接调用 DeepSeek V4.1 Flash——后者以更低成本和延迟取得相近表现。该评测显示,同时平衡任务成功率、可操控性、成本与延迟仍是模型路由的未解难题。
Jev Router 的端到端请求延迟高于同类 Pareto 最优模型,中位数为 6.18 秒,DeepSeek V4.1 Flash(Max)为 3.64 秒。在 P90(最慢 10% 请求)上差距扩大,Jev Router 耗时 30.59 秒,DeepSeek 为 14.26 秒。
Arena.ai 发布 Arena Alignment Index,一个衡量 AI 智能体真实使用中安全与对齐表现的新基准,基于 27 个模型的 90K+ 真实智能体会话构建,衡量未授权操作(UA)、错误归因(FA)和虚假完成(DC)三类信号。
LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。
LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。
Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。
Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。
Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。
Salesforce Ventures 宣布投资 Arena 的 B 轮融资。Arena 让真实用户对匿名模型输出投票,覆盖文本、编程、视觉、图像生成和智能体任务,其排行榜被实验室用于决定训练和发布哪些模型,也被开发者用于选型。投资方强调,这套机制成立的前提是没有实验室拥有这块记分牌。
LangSmith Engine v2 新增三项能力:对 AI 智能体进行红队测试、检测更多问题类型,以及自动测试提出的修复方案。@bentannyhill 在 Interrupt NYC 场次中讲解了这些更新及 LangChain 改进智能体的思路,完整视频已在 YouTube 发布。
Jerry Liu 认为,如今解决任务的主流方式已从直接定义确定性或智能体工作流,转为定义 eval 并对其爬山优化。数据提供方公司的全部工作就是为各类经济活动定义 eval,让前沿模型具备完成任何任务的能力;使用者的工作则变成给前沿智能指明方向——定义要解决什么、以及如何衡量做得好不好。最复杂的流程仍需要显式的工作流构建器界面,但大多数任务可以压缩为目标加 eval 指令。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。
Agent Arena 完整排行榜已上线,可在 arena.ai/leaderboard/ag… 查看。该榜单来自 lmarena.ai,用于展示 AI 智能体(Agent)的评测排名,完整数据以官方页面为准。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。
一篇题为《Old Ideas, Novel Problems》的论文研究基于 LLM 的新颖性评估的不稳定性,论文已在 Hugging Face 上线。该研究聚焦 LLM 用于评判研究新颖性时结果是否稳定可靠。
Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。
Perplexity 的 Decider V1.1 在 decisionbench.ai 上排名第一,949 个共享文本案例中准确率 93.9%,中位延迟 534 ms,成本 $0.016 / 1k decisions,为榜上最低。Rohan Goel 表示将把它用于自家产品的用例。
针对归藏老师今日关于 A÷ 刻意压价的帖子,有观点指出连"压价"本身都是假的:Haiku 采用阶梯定价,但上下文一旦达到 100k,价格就翻 5 倍,而 gpt 的分界线是 272k。图片里看似很低的价格,实际使用成本要高得多,被认为是面向 Benchmark 的特化优化,并借此打榜到第一。
AI Engineer New York 将 10 月 12 日设为工作坊日,参会者需自带笔记本电脑,在讲师带领下动手实践智能体工作流与评估。工作坊为会议附加环节,需另行选择场次,参会者可现场提问。
作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。
LovartAI 发布 Nano Banana 2.1 与 GPT Image 2.5 的人像生成对比图,称 Nano Banana 2.1 在光影和皮肤质感上大幅领先。
爱范儿作者提前拿到生数科技 Vidu Q4 Preview 预览版权限,用《沙丘》《喜剧之王》《黑神话:悟空》等片段实测其人物反应、动作运镜和特效表现,认为运镜方向感与主体稳定性是强项,画面风格控制和幻觉问题仍需优化。该预览版定位高表现力旗舰模型,参考生视频支持最多 15 张参考图、3 段参考音频和可选 2K、4K 输出,试拍成本 0.09 元/秒起。
UniPat AI 推出 PaperBenchX(PBX)评测,让 AI 在真实科学软件中复现已发表论文的关键实验。在覆盖 12 个科学方向的 93 道题中,70 道没有被任何配置完全复现,表现最好的 GPT-6 Astra 仅有 14% 的任务过关,国产模型基本在 7% 左右。评测发现建模和执行平均得分都在六成以上,但科学验证仅约 43%,多轮交互难以弥补这一差距。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
Haiku 5.5 在 Browser Use Bench v2.1 上跑出与 Luna 相同的性能,但价格是后者的 2.8 倍。Haiku 在上下文超过 100k 后价格再涨 5 倍,且缓存 token 也计入其中;而 BU Bench 2.1 多为极长时程任务,会频繁触及该定价档位。
Epoch AI 用 11 项自身真实工作任务测试六款模型,Claude Fable 5.1 与 GPT-6 Astra 总得分最高并领先多数任务类别,但仍无法实现工作全自动化。开源权重模型落后更多,连定义明确的任务也难以稳定完成。模型难以掌握 Epoch 的隐式规范,能提出研究方向却缺乏判断力,且常把有缺陷的结果当作关键发现。
Claude Haiku 5.5 已在 Devin 中上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,而每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,并可与 Opus 5.5 搭配,在 Devin Desktop 和 CLI 中以 Lead 角色使用。
Stack Overflow 博客的 LLM 生产系列 Level 2 讲解如何把评测当作 CI 门禁:用版本化 golden set 编写显式打分器,一条 CI 命令在通过率低于阈值时让构建失败,并按 slice 自动路由用例、逐 slice 设门槛。
Cursor 公布 Claude Haiku 5.5 定价为 $0.10/M 输入与 $0.50/M 输出 tokens,输入超过 100k tokens 后升至 $0.50/M 和 $2.50/M。
Perplexity 在 MADQA 基准上取得 92.4% 的成绩,该基准包含 500 道题、覆盖 800 份 PDF,这一结果在所有检索器中排名第一。
在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。
在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。