跳到正文
原文
Stanford AI Lab(@StanfordAILab)· Stanford AI Lab (@StanfordAILab)·· 2026-08-28AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Stanford 发布 Terminal-Bench-Science:面向科研工作流的 AI 智能体基准

Terminal-Bench-Science is out!

AI 导读

Stanford 联合全球科研机构专家发布 Terminal-Bench-Science,用于评估 AI 智能体在跨科学领域科研工作流中的表现,v0.1 版本包含 70 项任务。Claude Opus 5 在该基准上仅解出约 30%。该基准由 Terminal-Bench 团队打造,是一项持续进行的 Stanford 主导社区项目。

来源:Stanford AI Lab(@StanfordAILab) · x.com