METR·· 2025-07-14AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
METR 研究:AI 时间跨度如何因任务领域而异?
How Does Time Horizon Vary Across Domains?
AI 导读
METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。
来源:METR · metr.org