专为 Claude 优化的新键盘亮相
一款专为 Claude 优化的新键盘亮相,主打与 Claude 交互场景。原文仅提及该键盘"optimized for Claude",未披露品牌、型号、按键布局或售价等细节,也未说明是否已上市或开源。
一款专为 Claude 优化的新键盘亮相,主打与 Claude 交互场景。原文仅提及该键盘"optimized for Claude",未披露品牌、型号、按键布局或售价等细节,也未说明是否已上市或开源。
Poe 平台上线 Anthropic 的 Sonnet 5 与 Google 的 Nano Banana 2 Lite。Sonnet 5 被称为 Anthropic 迄今最具智能体能力的模型,具备 Opus 级编码与推理能力,成本更低。Nano Banana 2 Lite 是 Google 最快、最具性价比的图像模型,约 4 秒生成清晰一致的图像。
截止 8 月 31 日,Sonnet 5 在 Devin Desktop/CLI 中消耗的配额比 Sonnet 4.6 少约 30%,此后两者配额消耗相同。
Claude Sonnet 5 现已在 Devin Desktop 和 Devin CLI 上线。该模型在提供前沿级编程性能的同时价格更实惠,并在 FrontierCode Extended 上超过 Opus 4.8。
Anthropic 发布面向科学家的 AI 工作台 Claude Science,生命科学研究人员可在与 Claude 的对话中直接运行计算任务,从数据处理到结构预测再到分子设计。
Claude Code 桌面版的分屏(split screen)功能被用户称为最喜欢的功能之一。该推文展示了这一桌面端特性的使用画面,互动数据为 381 次点赞、35 条回复、14 次转发和 55251 次浏览。
XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。
Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。
GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。
Genspark 推出 Genspark Design,官方称这是由 Claude Opus 4.7 驱动的下一代设计与创作 AI,无需设计背景即可从粗略想法做出专业设计。
Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动,主打无设计背景也能从想法做出专业设计。该工具集 UI 原型、视频、HTML 动画、海报于一处,可上传 Figma 文件或保存设计稿建立品牌设计系统并在团队内复用,还能依托 Genspark Code 一键把应用或网页设计转成可运行代码。
Anthropic 推出 Claude Tag,让 Claude 以团队成员身份加入 Slack,可访问所选频道和工具、被 @ 后接受任务委派。Andrej Karpathy 认为这是 LLM 交互界面的第三次重大重构,前两次分别是网页版和被下载到电脑上的应用,这一次是自带工具与组织级上下文、持续存在且异步运行的实体,与人类团队并行工作。
Claude Tag 可按任意场景自定义,官方列出了 6 个内部用户和外部设计伙伴反馈较好的常见流程,其中之一是事件响应:在告警线程中 @Claude,它会拉取图表、对比部署差异,返回根因和被标记的作者,团队在线程内批准后由 Claude 提交修复、合并并持续观察指标恢复直至解决告警。
Anthropic 发布 Claude Tag 智能体权限配置入门指南,介绍如何设置 agent 身份以及团队在 Claude Tag 上做出的关键设计决策。相关说明可在 claude.com/blog/agent-ide 查看。
Anthropic 发布 Claude Tag,一种让团队与 Claude 协作的新方式。在 Slack 中,Claude 作为团队成员加入,可使用你指定的频道和工具,用户 @Claude 即可派发任务。Anthropic 员工表示,内部版本已合并 65% 的产品 PR,这是其首个原生支持多人协作并具备主动性的产品。
Anthropic 推出 Claude Tag,让 Claude 以团队成员身份进入 Slack,可访问用户指定的频道和工具。用户通过 @Claude 派发任务,自己可同时处理其他工作;转推者称这种用法更像管理团队而非使用工具。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。
吴恩达指出,过去两周美国政府与 Anthropic 先后采取行动,通过限制他人对前沿模型的使用来展示对 AI 访问权的控制力,这将加速企业和国家寻求不受他人终止的 AI 访问渠道。
John Jumper 宣布在近 9 年后离开 Google DeepMind,并加入 Anthropic。Demis Hassabis 回应称双方合作 9 年,AlphaFold 的成果展示了 AI 在科学与医学领域的可能性。
Claude Code 新增 Artifacts 功能,可基于会话生成交互页面,例如 PR 讲解或项目实时面板,并通过私有链接分享给团队成员,目前在 Team 和 Enterprise 计划的 beta 阶段提供。作者表示该功能已改变其团队内部的工作方式,适合用于沟通架构变更、数据分析和新原型。
Claude Code 新增 Artifacts,可根据会话生成 PR walkthrough、项目仪表盘等交互页面,并通过私有链接分享给团队,目前以 beta 形式面向 Team 和 Enterprise 套餐开放。Mike Krieger 表示,随着 Claude 的工作越来越深入和独立,让它在 Artifacts 中解释思路与产出很有价值,建议下次用它时让它把工作画成图。
Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。
高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。
Modal 发布多项产品更新,Functions 新增区域路由,可将请求经 US West、EU West 或 Asia Pacific South 转发,降低非 US East 来源的网络延迟。
Anthropic 表示,美国政府以国家安全为由发出出口管制指令,要求暂停所有外国国民(包括身处美国境外的及 Anthropic 的外籍员工)对 Fable 5 和 Mythos 5 的全部访问,因此必须对所有客户停用这两款模型,其他 Claude 模型不受影响。
素材记录了模型因出口管制被停用的处置过程,可观察合规事件如何传导到具体开发工具链。
Anthropic 推出的 Claude Design 能凭一句话生成高精度可交互原型,而 Codex 迟迟没有同类产品,原因是 GPT-5.5 的模型能力还扛不住这个活。作者指出 Claude Design 与 Codex 属于 Harness 产品层,真正的差距在模型层:可交互原型要求模型在画 UI 前先想清数据结构与状态管理,目前只有 Claude Opus 4.8 做到了。
Anthropic 的 Alex Albert 分享了 Fable 提示词指南中的一条技巧,指南还包含更多使用 Fable 的提示词方法。完整指南可在 platform.claude.com 的构建文档中查看。
Epoch AI 汇总约十五个网络安全基准构建 Cyber-ECI,评估 Anthropic Claude Mythos 系列在攻防能力上的真实位置。
Anthropic 发布提案,阐述政府应如何应对前沿 AI 带来的风险,并同步推出针对就业流失的政策框架,Anthropic 表示将为此提供大额资金支持。
Dario Amodei 表示,许多 AI 政策主张在政治光谱上都有常识性吸引力,越早采取行动,就能越早让所有人共享 AI 带来的好处。
Anthropic 长期主张对前沿 AI 施加透明度要求,理由是风险尚不够清晰、难以精准监管。Dario Amodei 表示,这种做法如今已不再足够。
同济大学长聘教授、OpenKG 发起人王昊奋认为,大模型越强,本体和知识图谱反而越重要,它们正是 AI Agent 所需的 harness。他把落地路线分为两派:Palantir 走本体优先、模型靠边,Claude 走模型优先、再补 MCP 与 skill,并称两者最终会你中有我。他还强调现有 AI 找的是相关性而非因果,严肃决策的解释权仍须握在人手里。
Claude Fable 5 正式上线 Monica AI,号称是 Anthropic 迄今最强的公开模型。该模型在编码、推理、视觉和长上下文任务上达到 SOTA,Stripe 借助它将数月的工程工作压缩到数天完成。
Anthropic 的 Alex Albert 表示已重置旗下各产品的用量限制,并为刚开始测试 Fable 的用户给出四条使用建议。
Poe 宣布 Claude Fable 5 已在其平台上线,称这是 Anthropic 迄今能力最强的模型,面向长时间运行的复杂工作,包括大规模代码迁移、深度研究和可运行数小时乃至数天的智能体会话。该模型在几乎所有测试基准上达到 SOTA,在编码、知识工作、科学研究和视觉方面表现突出,可通过 poe.com/Claude-Fable-5 使用。
Claude Fable 5 已在 Cognition 的 Devin 中上线,并在 FrontierCode 基准上拿下第一,该基准针对真实工程任务评估代码可合并性与质量。在最难任务上,其 FrontierCode Diamond 得分从 Opus 4.8 的 13.4% 提升至 29.3%。该基准发布仅一天后便迎来这一新登顶者。
Andrej Karpathy 称 Claude Fable 5 与 Mythos 是同一个底层模型,区别在于增加了安全措施,并在几乎所有测试基准上达到 SOTA。
v0 宣布 Claude Fable 5 现可在 v0 中使用,面向 Premium 和 Team 套餐开放,入口为 v0.app。所引 Anthropic 内容称 Claude Fable 5 是 Mythos 级模型,在面向通用场景开放前已做安全处理,能力超过其此前任何已开放模型。
Anthropic 发布 Claude Fable 5,描述为 Mythos 级模型,并称已将其做到可供通用使用,能力超过此前任何面向公众开放的模型。