跳到正文
原文
METR·· 2025-11-19AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

METR 评估 GPT-5.1-Codex-Max:50% 时间跨度 75 分钟至 350 分钟

GPT-5.1-Codex-Max Evaluation Results

AI 导读

METR 对 OpenAI GPT-5.1-Codex-Max 的评估显示,其 50% 时间跨度为 75 分钟至 350 分钟(点估计 2 小时 42 分),较 GPT-5-Thinking 呈符合趋势的提升,未发现风险关键性的能力、架构或训练激励变化。

来源:METR · metr.org