跳到正文

#编码

今日 2 条
今天10月10日周六
  1. InfoQAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Android Bench 2.0,新增长周期任务、智能体评测与连续评分

    Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。

  2. Lenny Rachitsky(@lennysan)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Surge 推出 sudo L7 基准:测试 AI 距离资深工程师还有多远,最佳智能体仅通过约 45% 任务

    Surge 发布 sudo L7 新基准,用于衡量 AI 距离 staff 级软件工程师的水平——结论是"我们走了一半"。该基准含 60 个任务,多数来自真实公司的私有生产仓库,由真正负责过这些系统的工程师编写,评分维度涵盖功能正确性、工程手艺、架构判断、协作与冗余复杂度。表现最好的智能体仅能成功完成约 45% 的任务,coding agent 仍停留在 L3 水平。

10月9日周五
  1. elvis(@omarsar0)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HERMES harness 将 GPT-5.6 Sol 仓库迁移成功率从 6.5% 提升至 31.0%

    论文发现,在整仓库迁移任务上,同一模型和相同 effort 设置下把 Codex 换成 HERMES harness 后,GPT-5.6 Sol 的成功率从 6.5% 升到 31.0%,收益来自 harness 本身。

  2. elvis(@omarsar0)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 提出 CI 程序修复智能体 FlowAgent,真实故障修复正确率 67.18%

    Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。

10月7日周三
  1. GitHub(@github)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 发布 ReviewBench:基于 1.039 亿 PR 分析的开源代码审查评测基准

    GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。

10月6日周二
  1. The JetBrains BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 提出 AI 生成代码审查框架:核心问题是信任校准

    JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。

10月5日周一
  1. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SelfSearch 让编码智能体改写自身 harness,成本 4.03 美元追平 Codex

    一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。

  2. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

10月3日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 发布 SWE-chat v2:23 万条真实开发者与 AI 编程智能体交互数据集上线 HuggingFace

    Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。

9月27日周日
  1. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ProgramDistill:从交互式 Web 应用生成可验证的参考引导 SWE 任务

    ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。

9月24日周四
  1. 山行AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:Claude Code 中真正拉开差距的是领域专长

    Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。

9月22日周二
  1. Hunyuan(@TXhunyuan)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元推出 WebCraftBench:用真机探索评测 AI 生成网站

    腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。

  2. AK(@_akhaliq)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CodeMidas:从代码本身扩展智能体编程 RL 环境

    论文提出 CodeMidas,一种从代码本身扩展智能体编程强化学习(RL)环境的方法,论文已发布在 HuggingFace Papers 上。

9月19日周六
  1. AK(@_akhaliq)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编码智能体 Harness 设计的实证研究

    一篇关于编码智能体 Harness 设计的实证研究论文发布在 Hugging Face,论文链接已公开。原文未披露具体模型、benchmark 分数或实验结果。

9月3日周四
  1. Suhail(@Suhail)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Proximal 发布 FrontierSWE v2 超长程编程基准,Claude Fable 5.1 大幅领先

    Proximal 发布超长程编程基准 FrontierSWE v2,新版本扩展了任务集并改进评测方法。各前沿模型在该基准上存在明显性能差距,Claude Fable 5.1 以较大优势领先。

  2. Firecrawl(@firecrawl_dev)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 开源 DevDex:衡量编码智能体搜索工具可靠性的 benchmark

    Firecrawl 开源 DevDex,一个用于评估搜索工具能否可靠找到编码智能体所需信息的 benchmark。该基准针对编码智能体高度依赖搜索工具获取答案的场景,衡量各工具找到正确来源的可靠性。

7月7日周二
  1. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象

    Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。

7月6日周一
  1. Import AI — Jack ClarkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 464:Fable 编写 GPU kernel、AI 自动化与模拟计算

    Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。

6月26日周五
  1. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月18日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 谈 DeLM:无需中心编排器的智能体协作,SWE-bench Verified 提升约 10%

    Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

6月9日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%

    Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。

4月10日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:MirrorCode 证据显示 AI 已能完成部分长达数周的编程任务

    METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等推出 CaP-X:面向机器人 coding agent 的开源框架与基准

    NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。

3月10日周二
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:大量通过 SWE-bench 的 PR 不会被合入主分支

    METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。

2月24日周二
  1. METRAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调整开发者生产力实验设计:AI 使用让任务变慢 19% 的结论受选择偏差影响

    METR 宣布修改其开发者生产力实验设计,原因是 2025 年 8 月启动的新实验因开发者拒绝在无 AI 条件下工作、时薪从 $150/hr 降至 $50/hr 等选择效应,数据无法可靠反映 AI 的真实生产力影响。

2月17日周二
  1. METRAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 用 Claude Code 转录分析 AI 智能体的生产力增益上限

    METR 用 5305 份 2026 年 1 月由 7 名技术人员生成的 Claude Code 转录,借助 LLM judge 估算无 AI 时的任务耗时,得出 AI 辅助任务的时间节省因子约 1.5x 到 13x。该结果被作者视为真实生产力增益的软上限,因任务替换、任务选择、既有专长等因素可能高估。方法仅在 34 条人工标注上验证,且数据仅覆盖单一月份、单一工具。

2月13日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 对比测试:Claude Code 与 Codex 测量时间跨度不比默认脚手架更好

    METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。

2月4日周三
  1. Binyuan Hui(@huybery)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-Universe:让 coding agent 自己构建训练环境,GitHub PR 变身可验证 SWE 环境

    SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。

11月19日周三
  1. METRAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评估 GPT-5.1-Codex-Max:50% 时间跨度 75 分钟至 350 分钟

    METR 对 OpenAI GPT-5.1-Codex-Max 的评估显示,其 50% 时间跨度为 75 分钟至 350 分钟(点估计 2 小时 42 分),较 GPT-5-Thinking 呈符合趋势的提升,未发现风险关键性的能力、架构或训练激励变化。

11月13日周四
  1. Binyuan Hui(@huybery)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-fficiency 发布:评估 LM 能否加速真实 GitHub 仓库

    SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。

11月5日周三
  1. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CodeClash:让大模型通过代码库多轮对战实现高层目标的新评测

    John Yang 推出新评测 CodeClash,让大模型在代码库中通过多轮锦标赛相互竞争,以实现最大化收入、削减成本、赢得用户等高层目标。该评测不同于现有针对“修 bug”“写测试”等具体任务的测试方式,转而在目标层面考察模型的编码能力。

9月1日周一
  1. Berkeley AI Research BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    word2vec 究竟学到了什么:伯克利证明其等价于对特定矩阵做 PCA

    伯克利 AI 研究团队给出 word2vec 的定量学习理论,证明在实际可实现的训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,最终学到的嵌入等价于对矩阵 M* 做 PCA,该矩阵仅由词共现统计和超参数决定。梯度流动力学有闭式解:从小初始化出发,word2vec 按离散步骤逐个学出正交线性子空间,每步提升嵌入矩阵的秩并阶梯式降低损失,各特征即 M* 的顶层特征向量。

8月13日周三
  1. METRAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:算法评分会高估 AI 智能体的软件任务表现

    METR 在一项研究更新中对比了算法评分与人工整体评审两种方式:在来自 stdlib-js 和 hypothesis 两个开源仓库的 18 个真实任务上,使用 Claude 3.7 Sonnet 的 Inspect ReAct 智能体按人工编写的测试用例衡量平均成功率为 38%(±19%,95% CI),但人工评审的 15 个 PR 没有一个可以直接合并。

7月14日周一
  1. METRAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:AI 时间跨度如何因任务领域而异?

    METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。

7月10日周四
  1. METRAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 随机对照实验:AI 让资深开源开发者慢 19%

    METR 招募 16 名来自大型开源仓库的资深开发者,对 246 个真实 issue 随机分配是否允许使用 AI,结果允许用 AI 时完成任务耗时反而增加 19%,而开发者预期 AI 提速 24%,实际经历放慢后仍自认为提速 20%。