Scott Wu(@ScottWu46)· Scott Wu (@ScottWu46)·· 2026-06-09AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%
SWE-Bench style grading has been the standard for years now - you ask the agent to solve an issue an...
AI 导读
Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。
来源:Scott Wu(@ScottWu46) · x.com