跳到正文
原文
硅星人Pro·· 2 天前AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

UniPat AI 推出 PaperBenchX:10 个前沿 Agent 复现论文集体翻车

复现论文,10 个模型集体“翻车”!PaperBenchX 找到了 AI 科研的卡点

AI 导读

UniPat AI 推出 PaperBenchX(PBX)评测,让 AI 在真实科学软件中复现已发表论文的关键实验。在覆盖 12 个科学方向的 93 道题中,70 道没有被任何配置完全复现,表现最好的 GPT-6 Astra 仅有 14% 的任务过关,国产模型基本在 7% 左右。评测发现建模和执行平均得分都在六成以上,但科学验证仅约 43%,多轮交互难以弥补这一差距。

来源:硅星人Pro · mp.weixin.qq.com