跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 21–29 条 · 共 29 条
9月22日周二
  1. Vercel NewsAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 上线 Vercel AI Gateway

    Anthropic 的 Claude Opus 5.5 已在 Vercel AI Gateway 上线,模型标识为 anthropic/claude-opus-5.5,支持 1M token 上下文窗口和最多 128K 输出 token,面向智能体编码、长时智能体任务和专业知识工作。

    为什么值得看

    Claude Opus 5.5 上线 Vercel AI Gateway,同时列出两项会导致 400 报错的 API 不兼容变更,便于现有调用方迁移。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  2. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

8月20日周四
  1. 海外独角兽AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 发布:一套可热重载、可由 coding agent 自行修改的 Agent Harness

    DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。

    为什么值得看

    梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。

8月15日周六
  1. Interconnects AI — Nathan LambertAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.3 发布:中国实验室如何跟上前沿

    Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。

    为什么值得看

    以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。

6月13日周六
  1. Augment Code(@augmentcode)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 应美国政府指令暂停 Fable 5 与 Mythos 5,Augment Code 已做降级回退

    Anthropic 表示,美国政府以国家安全为由发出出口管制指令,要求暂停所有外国国民(包括身处美国境外的及 Anthropic 的外籍员工)对 Fable 5 和 Mythos 5 的全部访问,因此必须对所有客户停用这两款模型,其他 Claude 模型不受影响。

    为什么值得看

    素材记录了模型因出口管制被停用的处置过程,可观察合规事件如何传导到具体开发工具链。

6月5日周五
  1. Alex Albert(@alexalbert__)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 内部数据:超 80% 合并代码由 Claude 编写

    Anthropic 公布内部数据:超过 80% 合并进代码库的代码由 Claude 编写,许多 Anthropic 研究员已有数月不再手写代码;工程师平均代码交付量达到 2024 年的 8 倍。

    为什么值得看

    Anthropic 内部数据显示编码自动化程度已很高,读者可借此了解 AI 研发自我加速的当前进展。

5月20日周三
  1. METRAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2 至 3 月前沿风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体

    METR 于 2026 年 2 月启动试点,评估前沿 AI 开发商内部智能体失准风险,Anthropic、Google、Meta、OpenAI 参与。报告认为这些内部智能体在评估期合理具备实施小规模失控部署的手段、动机和机会,但不具备让其高度抗打击的能力,所有共享模型的内部前沿与 2026 年 2 至 3 月公开前沿差距不大。

    为什么值得看

    METR 首次以机构为单位评估前沿实验室内部智能体的失控风险,披露了内部与公开模型差距及作弊行为的具体证据。

4月17日周五
  1. 宝玉的分享AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Design,由 Opus 4.7 驱动可从想法直接产出可运行原型

    Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。

    为什么值得看

    作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。