跳到正文
原文
Epoch AI· Tom Adamczewski·· 2026-06-26AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

MirrorCode: What's the largest software project AI can complete on its own?

AI 导读

Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

来源:Epoch AI · epoch.ai