METR 解析 AI 生产力提升的三种度量:Task Substitution and Uplift
METR 提出 AI 生产力提升(uplift)的三种定义:旧任务提升、价值提升与新任务提升,并论证在简化假设下三者满足旧任务提升 ≤ 价值提升 ≤ 新任务提升。以软件工程师每日 8 小时写文档与 pull request 为例,若 AI 将写 PR 效率提高一倍,旧任务提升为 +33%,新任务提升为 +50%,价值提升则介于两者之间。
METR 提出 AI 生产力提升(uplift)的三种定义:旧任务提升、价值提升与新任务提升,并论证在简化假设下三者满足旧任务提升 ≤ 价值提升 ≤ 新任务提升。以软件工程师每日 8 小时写文档与 pull request 为例,若 AI 将写 PR 效率提高一倍,旧任务提升为 +33%,新任务提升为 +50%,价值提升则介于两者之间。
METR 对 Anthropic 2026 年 2 月风险报告中"自动化研发风险"章节完成外部评审,认为该报告不足以支撑其结论。METR 指出报告在分析严谨性上存在明显问题,包括模型使用调查的样本量、问题粒度和问卷框架,并认为调查结果对整体风险水平提供的证据有限;报告还将一项问题的缺失回答误计为负面回答。
Claude Code 团队成员 Thariq 提出用 HTML 取代 Markdown 作为 AI 智能体的输出格式,理由是 HTML 信息密度更高、支持表格与 SVG 图表、便于分享和双向交互。
Alex Albert 称,在 Claude Mythos Preview 的帮助下,Firefox 团队 4 月修复的安全漏洞数量超过了过去 15 个月的总和。
Alex Albert 今日全天出席 Code with Claude 活动,并将在太平洋时间下午 5:30 主舞台发表演讲,该演讲将在 livestream 播出。活动议程包括 9:00 主题演讲、10:30 的 Claude Code 新功能、11:15 的 GitHub 规模构建 Claude、12:00 的 Managed Agents 加速生产(均为 PT)。
Anthropic 宣布即日起对 Claude Code 做三项调整:Pro、Max 与 Team 套餐的 5 小时速率限制翻倍;Pro 和 Max 套餐取消 Claude Code 的高峰时段限额下调;同时大幅提高 Opus 模型的 API 速率限制。
在 5 月 6 日的 Code with Claude 旧金山场,Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 同台对话,Dario 称公司原本按每年 10 倍准备算力,但 2026 年第一季度增速年化约 80 倍,这是 Claude 一直限速的直接原因,他直言 80 倍太疯狂、希望回落到 10 倍。
Anthropic 内部 Claude Code 创建者 Boris Cherny 在 Sequoia AI Ascent 访谈中表示,他整个 2026 年没写过一行代码,每天合并几十个 PR,工作方式变成在 Claude App 里同时管理几百个 Agent,靠 cron 驱动的 Loop 模式自动盯 PR、修 CI、抓取反馈。
Eugene Yan 总结自己与 AI 协作的方法,提出五条原则:提供好的上下文、把个人偏好编码成配置、让验证变简单、委派更大的任务、并闭环沉淀。具体做法包括把代码和知识库分层组织、为每个项目维护带注释的 INDEX.md、用 CLAUDE.md 当作行为契约并按目录分级加载、把高频操作做成按需加载的 skill,以及在会话中纠正输出而非直接改文件,让转录成为配置更新的输入。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。
Claude Security 现已进入公开测试,内置于网页版 Claude Code 中。用户将仓库指向该功能后,可获得经过验证的漏洞发现结果,并在同一处代码编写环境中完成修复。
GitHub Copilot 宣布自 2026 年 6 月 1 日起所有计划改为按用量计费,用户每月订阅费将等值兑换为 token 额度。此前微软长期补贴用户算力,2023 年《华尔街日报》曾报道部分用户每月造成高达 80 美元成本,而订阅费仅 10 美元。Anthropic 也曾允许每 1 美元订阅烧掉超过 8 美元计算成本。
小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。
DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。
DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。
Claude Code 团队在对话中讨论了该产品如何保持迭代速度,以及 AI 时代产品管理角色的变化和未来工作形态。相关对谈已在 Spotify 上线。
Monica AI 已上线 Claude 4.7 Opus 和 GPT Image 2,前者带来更强的推理与深度分析能力,后者提供图像生成。官方称此次更新覆盖编程、写作与设计场景,用户可在 monica.im 体验。
Anthropic Claude Code 产品负责人 Cat Wu 在 Lenny's Podcast 中称,面试几百名 PM 候选人后发现,大多数人仍在用 6-12 个月路线图思维找工作,而 Claude Code 团队已把功能交付周期从半年压缩到一周甚至一天。
METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。
Anthropic Labs 推出 Claude Design,用户可通过与 Claude 对话制作原型、slides 和 one-pager。该功能由 Claude Opus 4.7 驱动,官方称其为能力最强的视觉模型,目前以研究预览形式在 Pro、Max、Team 和 Enterprise 套餐上线,当天陆续推送。
Anthropic 的 Alex Albert 表示,用户昨天首次尝试 Opus 4.7 时可能遇到的多个 bug 现已修复,并感谢用户的耐心。他引用的 Ethan Mollick 推文称,Opus 4.7 的 Adaptive Thinking 现在更频繁地触发思考,包括昨天失败的任务,同时也带来更多网络搜索,在非编码任务上的输出质量有明显提升。
黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。
Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。
Opus 4.7 发布,附带又一份 200+ 页的系统卡,让作者直言模型发布速度已超过自己的阅读速度。此前 Mythos 的系统卡他还没读完。
Anthropic 推出面向 Claude 开发者的账号 ClaudeDevs,用于集中发布更新。该账号将提供 changelog、API 发布、社区动态和深度技术内容,为使用 Claude 构建应用的开发者提供来自团队的直接信息渠道。
Claude Code 已将 Opus 4.7 的默认 effort level 设为 xhigh,用户可用 /effort 命令自行调整。官方邀请用户体验并反馈。
让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。
Claude Opus 4.7 在 Claude Code 上线。官方建议把它当作可以委派任务的工程师,而不是逐行指导的结对程序员,并给出三条配套的工作流调整建议。
Anthropic 在博客中发布了 Claude Opus 的新消息,并邀请用户反馈意见。原文仅给出博客链接 anthropic.com/news/claude-op,未披露具体版本号、参数或功能细节。
Anthropic 联合创始人 Mike Krieger 宣布 Claude Opus 4.7 发布,称其在模糊、多步骤任务上比 4.6 表现更好。他给出 Cursor 内部基准成绩从 4.6 的 58% 提升到 70% 以上;Notion 在自身评测中看到 14% 的提升,工具错误减少到原来的三分之一。
Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。
Opus 4.7 在 Yoruba、Igbo 和 Chichewa 等训练数据较少的语言上显示出提升。Poe 表示,对这些语言及其他语言的使用者来说,该模型将有明显改善。
Opus 4.7 在底层换用了新的 tokenizer。测试显示,相比 Opus 4.6,它可能多消耗 1x 到 1.5x 的 token,建议据此提前规划用量。
Poe 早期测试显示,Opus 4.7 处理长时任务更严谨、指令遵循更精确,并会在汇报前自行验证输出,面向可减少人工监督的托管式工作。
Poe 宣布 Claude Opus 4.7 已在平台上线,称其为 Anthropic 目前能力最强的模型,在编码、推理、长上下文理解、工具调用、视觉和多步智能体工作流方面有大幅提升。用户可在各平台的 Poe 应用及 Poe API(poe.com/Claude-Opus-4.7)中试用。
Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。
Anthropic 的 Anthony Morris 宣布 Claude Code 桌面版重做上线,应用从头设计以便更容易并行处理任务。用户 cat 表示自己已连续数周每天使用该桌面版,它可以在同一处启动和管理本地与云端的多个 Claude Code 会话,还能查看 git 状态、固定活跃会话,并通过拖拽布局同时查看多个会话。
Anthropic 员工 Thariq 撰文讲解 Claude Code 的会话管理方法,围绕上下文窗口升级到 100 万 Token 后,如何在继续、回溯、清空(/clear)、压缩(/compact)和子智能体五种选择间做决策。
Claude Code 桌面端发布新版本,带来大量新功能和性能改进,并重做了桌面端界面。用户现在可以在一个窗口里并行运行多个 Claude 会话,并用新的侧边栏统一管理这些会话。Alex Albert 表示,在 Cowork 和 Code 之间切换后,做大部分工作已不太需要打开其他应用甚至终端。
Anthropic 的 jiaxinwen22、liangqiu_1994、Joe Benton 与 janhkirchner 完成了一项新研究,Jan Leike 转发称赞并附上博文链接。博文地址为 anthropic.com/research/autom,具体方法与结论详见原博客。
Jan Leike 公布一项新研究结果:团队用 Claude 在可扩展监督研究上实现完全自主的进展,以 performance gap recovered(PGR)衡量,Claude 迭代多种不同技术,最终以 1.8 万美元额度显著超过人类研究者。