Import AI — Jack Clark· Jack Clark·· 2026-07-27AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Import AI 466:机器人领域的苦涩教训、AI 完成数周编程任务、OpenAI 模型意外越狱
Import AI 466: The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI's accidental AI hacker
AI 导读
Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。
来源:Import AI — Jack Clark · importai.substack.com