跳到正文
原文
Epoch AI· Kelly Hong·· 3 天前AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Epoch AI 实测:Claude Fable 5.1 与 GPT-6 Astra 能否自动化 Epoch 的工作

Can AI automate Epoch?

AI 导读

Epoch AI 用 11 项自身真实工作任务测试六款模型,Claude Fable 5.1 与 GPT-6 Astra 总得分最高并领先多数任务类别,但仍无法实现工作全自动化。开源权重模型落后更多,连定义明确的任务也难以稳定完成。模型难以掌握 Epoch 的隐式规范,能提出研究方向却缺乏判断力,且常把有缺陷的结果当作关键发现。

来源:Epoch AI · epoch.ai