METR·· 2026-03-19AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
METR 实测 200 小时时间跨度 AI:2 小时沙盘推演未来工作流
We spent 2 hours working in the future
AI 导读
METR 三名研究员以约 200 小时时间跨度的 AI 进行了 2 小时沙盘推演,模拟 12-18 个月后的工作方式,获得约 3-5 倍效率提升。推演中 AI 在可验证任务上表现为 200 小时达 50% 成功率、40 小时达 80% 成功率,速度为 Claude 4.6 Opus 快速模式的两倍,写作能力在有上下文时相当于 METR 初级员工。
来源:METR · metr.org