跳到正文
原文
METR·· 2026-07-21AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

METR 提出"支出视界"指标衡量 AI 优化能力,并以 NanoGPT 为例

Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT

AI 导读

METR 提出用"支出视界"(expenditure horizon)量化 AI 智能体的优化能力,即 AI 与人类在同等预算下效率持平的美元成本。在 NanoGPT speedrun 的实测中,人力边际上每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化跑在花费超 1 万美元后,估计支出视界仅为 0–3000 美元。

来源:METR · metr.org