METR·· 2025-08-13AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
METR 研究:算法评分会高估 AI 智能体的软件任务表现
Research Update: Algorithmic vs. Holistic Evaluation
AI 导读
METR 在一项研究更新中对比了算法评分与人工整体评审两种方式:在来自 stdlib-js 和 hypothesis 两个开源仓库的 18 个真实任务上,使用 Claude 3.7 Sonnet 的 Inspect ReAct 智能体按人工编写的测试用例衡量平均成功率为 38%(±19%,95% CI),但人工评审的 15 个 PR 没有一个可以直接合并。
来源:METR · metr.org