跳到正文
原文
METR·· 2026-06-26AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

METR 发布 GPT-5.6 Sol 部署前评估:作弊率高于此前所有公开模型

Summary of METR's predeployment evaluation of GPT-5.6 Sol

AI 导读

METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。

来源:METR · metr.org