跳到正文

#Anthropic

今日 74 条
6月10日周三
  1. Mike Krieger(@mikeyk)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布新模型:多数测试基准达 SOTA,API 定价 $10/$50

    Anthropic 新模型在测试的几乎所有基准上达到 SOTA,任务越长领先幅度越大。该模型已为通用发布做好安全处理,涉及网络与生物类请求会透明回退到 Opus 4.8,95% 以上的会话不会遇到此类回退。API 定价为 $10/$50,今日起在付费 Claude 套餐中提供。

  2. Mike Krieger(@mikeyk)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Fable 5,首个面向所有人开放的 Mythos 级模型

    Claude Fable 5 发布,是首个所有人可用的 Mythos 级模型。发布者称这也是他第一次把完整项目交给模型处理,并在周末用两天时间借助 Fable 分块完成了一个可自我维护、主动推送的媒体追踪工具。

  3. AnthropicAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Fable 5

    Anthropic 发布新模型 Claude Fable 5。原文仅提供标题与发布来源,未包含模型能力、版本参数等具体信息。

6月9日周二
  1. v0(@v0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 Max 现已由 Claude Opus 4.8 驱动

    v0 Max 现已由 Claude Opus 4.8 驱动。该消息由 v0 官方账号发布,未披露其他参数或功能细节。

6月8日周一
  1. Citrini ResearchAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 发布 2026 年 6 月主题投资报告:从 tokenmaxxing 转向 tokenpanic

    Citrini Research 发布 2026 年 6 月《State of the Themes》,指出市场叙事已从 tokenmaxxing 转向 tokenpanic:agent 与更强推理模型推动 token 用量激增,但成本压力随之爆发,Uber 四个月烧完全年 AI 预算、Anthropic ARR 自年初增长 5 倍至 5 月达 450 亿美元。

  2. Import AI — Jack ClarkAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 460:社会可被 reward hacking、Anthropic 的 RSI 数据、RL 无人机竞速

    Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。

  3. 开始连接LinkStartAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    锦秋基金复盘 2026 上半年 AI:硅谷大转弯、模型吞噬应用与创业者的真机会

    锦秋基金合伙人臧天宇、郑晓超在播客中复盘 2026 上半年 AI 行业,用「重估」与「世界模型」概括,并梳理三场模型战争:OpenAI vs Anthropic vs Google、视频模型的「GPT-3 时刻」、具身智能的 VLA 与世界模型路线之争。对创业者,核心问题是中国还是美国、以及模型吞噬应用下垂类 AI 的活路。

6月5日周五
  1. cat(@_catwu)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Claude Code 招聘模型性能方向 PM

    Anthropic 正为 Claude Code 招聘一名专注模型性能的产品经理,要求有编写智能体评测(agentic evals)经验,并能将研究思路落地到核心产品中。申请入口为 Anthropic 的 Greenhouse 招聘页。

  2. Alex Albert(@alexalbert__)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 内部数据:超 80% 合并代码由 Claude 编写

    Anthropic 公布内部数据:超过 80% 合并进代码库的代码由 Claude 编写,许多 Anthropic 研究员已有数月不再手写代码;工程师平均代码交付量达到 2024 年的 8 倍。

    为什么值得看

    Anthropic 内部数据显示编码自动化程度已很高,读者可借此了解 AI 研发自我加速的当前进展。

6月4日周四
  1. cat(@_catwu)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 数据团队用 Claude 自动化 95% 业务分析查询

    Anthropic 数据团队借助 Claude 自动化了 95% 的业务分析查询,并发布博客介绍其构建数据分析智能体时在技能、数据基础与评估上的最佳实践,涵盖 evals、消融实验和在线验证方法。

  2. 开始连接LinkStartAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌还在追赶 OpenAI 和 Anthropic?这是 Google I/O 2026 最大的误读

    谷歌在 Google I/O 2026 上缺席 Gemini 3.5 Pro、未更新 Veo,被外界视为遗憾,但极客公园播客邀请亲赴现场的 Bryan Liu 与作者 Alan 解读这场发布会背后的野心。节目指出谷歌把模型分成「干活的」和「思考的」,并借 Gemini Spark、Gemini 重写操作系统及谷歌眼镜,展现将讲故事权利还给所有人、成为用户「外置大脑」的方向。

6月1日周一
  1. Andrew Ng(@AndrewYNg)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达谈 AI Forward Deployed Engineer:FDE 岗位复兴,但 AI Engineer 需求更大

    OpenAI 和 Anthropic 开始组建团队、把 AI Forward Deployed Engineer(FDE)派驻到客户组织内,推动这一岗位在硅谷复兴。FDE 需兼具技术、沟通乃至业务能力,负责把现成 LLM 定制成贴合客户需求的智能体工作流。吴恩达认为 AI Engineer 的岗位数量将远超 FDE,因为企业更愿意让自家员工做项目,且厂商中立的 FDE 难以寻找。

  2. Import AI — Jack ClarkAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 459:AI 监管之难、蛋白质折叠模型的缩放定律、AI 系统灭绝风险的定价

    Import AI 459 聚焦三项研究:弗吉尼亚大学、Anthropic 与加拿大银行的经济学家测算美国 AI 经济名义规模 2025 年约 2500 亿美元。

  3. 强少来了AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有意思小周刊No.169(2026.06.01):Codex国内也能畅快用,亲测有效

    有意思小周刊 No.169 介绍了三种在国内无需开通 ChatGPT Plus 即可使用 Codex 的方法:手动配置 config.toml 接入第三方 API、用图形化工具 Codex++ 简化配置、以及通过 CCX 网关配合 CC Switch 做协议转换与供应商管理,作者亲测后强烈推荐支持插件功能的 Codex++。

5月29日周五
  1. AI ExplainedAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8:你可能错过的 15 个细节

    AI Explained 发布视频,梳理 Claude Opus 4.8 中可能被忽略的 15 个细节。

  2. Monica_IM(@hey_im_monica)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 4.8 Opus 正式上线 Monica AI

    Claude 4.8 Opus 已在 Monica AI 正式上线,官方称其为迄今最先进的推理模型,具备更深入的分析、更敏锐的逻辑和更细致的表达。该模型适用于研究、编码和战略思考等任务,用户可通过 monica.im 体验。

  3. Poe(@poe_platform)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8 上线 Poe

    Poe 平台宣布 Claude Opus 4.8 已在 Poe 上线,用户可通过 poe.com/Claude-Opus-4.8 直接使用。Anthropic 这款最新旗舰模型面向企业级知识工作、代码库规模迁移、多智能体协调和长时间自主任务,并提升了判断力与诚实度。

  4. cat(@_catwu)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出 research preview 版动态工作流

    Claude Code 新增 research preview 版动态工作流(dynamic workflows)。Claude 会即时编写编排脚本,并行启动大量协同子智能体处理复杂任务,在提示词中使用 workflow 一词即可启用。

  5. cat(@_catwu)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Code 动态工作流并行清查数百个 A/B 测试 flag

    有人用 Claude Code 的动态工作流并行排查公司数百个 A/B 测试 flag,找出已全量(100%)或从未放量(0%)的陈旧项以便下架清理,整个过程耗时不到 10 分钟,而顺序逐个调查则需等待 Claude Code 依次处理。

  6. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出动态工作流功能

    Claude Code 推出动态工作流功能,用户在提示词中提到 workflow,Claude 就会动态生成一份编排计划并严格遵循执行。官方称该功能让上百个 Agent 协作时各阶段仍能按正确顺序发生。

  7. Alex Albert(@alexalbert__)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Opus 4.8 校准思考量,邀请用户反馈过度或不足思考案例

    Anthropic 为 Opus 4.8 的思考量(thinking effort)做了大量校准工作。官方邀请用户在试用模型时,若遇到仍过度思考或思考不足的案例,向其反馈。团队成员 kipply 也同步征集 Claude 在任务中思考过多或过少的示例。

  8. cat(@_catwu)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bun 借助动态工作流从 Zig 移植到 Rust,约 75 万行代码 11 天合并

    @jarredsumner 使用动态工作流将 Bun 从 Zig 移植到 Rust,涉及约 75 万行代码,测试套件通过率 99.8%,从首次提交到合并历时 11 天,期间数百个智能体并行工作,每个文件由两名审查者把关。详情见 claude.com/blog/introduci…

  9. cat(@_catwu)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 4.8,已在 Claude Code 上线

    Anthropic 发布 Opus 4.8,官方称其在诚实度上有明显提升,会承认自己不知道的内容,并在自己的代码中主动标出问题而不是掩饰。该模型被推荐用于 Claude Code 的日常使用,并已当天在 Claude Code 中上线,更多细节见所引推文。

  10. cat(@_catwu)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出动态工作流研究预览

    Claude Code 推出动态工作流功能,目前处于研究预览阶段。该功能让 Claude 编写编排计划,将任务分发给数百个子智能体,并在结果返回前进行复核,官方称在 auto 模式下效果最佳。

  11. Alex Albert(@alexalbert__)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.8 快速模式上线:约 2.5 倍速、价格降至三分之一

    Claude Opus 4.8 的快速模式已上线,同一个模型速度约为原来的 2.5 倍,价格比之前便宜三倍。在 Claude Code 中用 /fast 开启,API 用户需联系客户经理申请权限或加入等待列表(claude.com/fast-mode)。Alex Albert 表示自己把快速模式用于需要即时反馈的交互任务,普通模式留给不急着要结果的长时异步任务。

  12. v0(@v0)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 现已支持 Claude Opus 4.8

    v0 现已支持调用 Claude Opus 4.8,用户可在 v0.app 直接使用。该消息由 v0 官方账号发布,未披露更多参数或可用范围细节。

  13. Mike Krieger(@mikeyk)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8 今日发布:更诚实、能自查代码缺陷

    Claude Opus 4.8 于今日发布,Mike Krieger 试用数周后称其已成为首选模型。该模型对自己的工作更诚实、会标注不确定之处,并在交付前发现代码中的缺陷。

  14. Mike Krieger(@mikeyk)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.8 并为 claude.ai 与 Cowork 加入 effort control

    Anthropic 发布 Claude Opus 4.8,在 Opus 4.7 基础上提升判断力、对自身进展的诚实度,并能比前代独立工作更长时间,今日上线且价格与 4.7 相同。同时 claude.ai 与 Cowork 在模型选择器旁新增 effort control,难题调高、快速回答调低。

  15. Mike Krieger(@mikeyk)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出 Dynamic Workflows,可组建子智能体团队

    Anthropic 的 Mike Krieger 宣布 Claude Code 上线 Dynamic Workflows,可让 Claude 拉起一组子智能体协同工作、验证并回传结果。他本人用它做过整个代码库的语言迁移,以及完成复杂项目,并建议在 auto 模式下使用效果最佳。

  16. Alex Albert(@alexalbert__)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.8

    Anthropic 发布 Claude Opus 4.8,官方称在 Opus 4.7 基础上做了多处修复,对细微差别的理解更好、对话更自然,在编码和知识工作中整体协作能力更强。该版本判断力更敏锐,对自身进展更诚实,能比前代独立工作更长时间,发布当日起以相同价格提供。

5月28日周四
  1. 枫言枫语AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    枫言枫语 Vol. 167:Token 如流水,Agent 似朝阳

    播客《枫言枫语》第 167 期盘点近期科技新闻:OpenAI 与微软终止独家合作,Anthropic 的 Project Glasswing 发现大量高危漏洞,企业面临大模型 Token 成本压力。

5月27日周三
  1. 张小珺Jùn|商业访谈录AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    雨森的创投观察第2集:Harness、下一个字节、2026大机会和 Stanley Druckenmiller

    真格基金管理合伙人戴雨森在《雨森的创投观察》第2集回应第1集"被打脸"往事,提出"AGI是在缩水的"和"字节系创始人要把在字节学的东西自己颠覆自己"两个暴论。他认为Harness更像OS、模型更像处理器,Manus、Claude Code、OpenClaw、Codex、Hermes是用户喜欢的Coding Agent Harness。

5月26日周二
  1. Import AI — Jack ClarkAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 458:直面 AI 的未来,以及一个奇点故事

    Jack Clark 在 Import AI 458 中发布一篇长文,基于其在牛津大学 HAI Lab 所做的 2026 Cosmos 讲座,提出面对 AI 持续进步只有两种选择:探索未来,或从当下退缩。他认为 AI 不是普通技术,能力增长速度可能远超预期,并给出一个判断:AI 可能即将能自行开发继任者,从而启动递归自我改进。

  2. Last Week in AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #246:Gemini 3.5 与 Omni、Musk 败诉、OpenAI 对阵 Erdős 问题

    Google I/O 发布 Gemini 3.5(重点推 3.5 Flash 的速度与基准成绩)、常驻智能体 Gemini Spark 和视频生成编辑模型 Gemini Omni。

5月23日周六
  1. Ideogram(@ideogram_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 推出 MCP,让 Claude 变身世界级设计智能体

    Ideogram 发布 Ideogram MCP,可在对话中直接生成图像、设计并训练自定义模型,无需离开聊天界面。该 MCP 同样支持 ChatGPT、Cursor、Hermes 等。

  2. Eric Jing(@ericjing_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 与 Anthropic 合作,将 Claude 模型能力转化为知识工作者的产品体验

    Genspark 宣布与 Anthropic 合作,把 Claude 的模型能力转化为面向知识工作者的产品体验。Genspark 联合创始人兼 CTO Kay Zhu 表示,Genspark 是基于 Claude 打造的一体化 AI 工作空间。

5月20日周三
  1. Last Week in AIAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #245:TML-Interaction、Claude For Legal、Sam Altman 出庭作证

    OpenAI 在 API 中上线 GPT Realtime 2(由 GPT-5 驱动)等语音智能功能,并加入实时翻译与 Whisper 转写;Thinking Machines 预览了双模型架构的低延迟全双工对话系统,但尚未开放公测。

  2. Scott Wu(@ScottWu46)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 的 Scott Wu 谈与 Anthropic 的深度合作及构建于 Claude 的 Devin

    Cognition 的 Scott Wu 表示珍视与 Anthropic 团队的合作,并调侃自己中学数学视频的梗挥之不去。Cognition 是 AI 软件工程师 Devin 背后的团队,Devin 构建于 Claude。Scott Wu 希望让每个工程团队构建软件的速度提升 10 倍。

  3. METRAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2 至 3 月前沿风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体

    METR 于 2026 年 2 月启动试点,评估前沿 AI 开发商内部智能体失准风险,Anthropic、Google、Meta、OpenAI 参与。报告认为这些内部智能体在评估期合理具备实施小规模失控部署的手段、动机和机会,但不具备让其高度抗打击的能力,所有共享模型的内部前沿与 2026 年 2 至 3 月公开前沿差距不大。

    为什么值得看

    METR 首次以机构为单位评估前沿实验室内部智能体的失控风险,披露了内部与公开模型差距及作弊行为的具体证据。

  4. METRAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2-3 月前沿 AI 风险报告:Anthropic、Google、Meta、OpenAI 参与内部智能体评估

    METR 发布 2026 年 2 月 16 日至 3 月 16 日的前沿 AI 风险评估试点报告,Anthropic、Google、Meta 和 OpenAI 参与,METR 获得了各家当时最强内部模型(含原始思维链)的访问权限。评估认为这些内部智能体很可能具备发起小规模未授权部署的手段、动机和机会,但尚不具备使其高度稳健的能力;METR 计划在 2026 年晚些时候再次开展类似评估。