Anthropic 用 Claude 优化 30 多个开源模型推理,平均提速 4 倍并开源代码
Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个开源模型优化推理,平均提速 4 倍,部分工作是为 GPU 编写定制软件。这些模型面向分子系统结构建模、类药物分子设计和基因突变影响预测等生物学科研任务,此前运行成本较高。Anthropic 表示将开源全部优化代码。
Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个开源模型优化推理,平均提速 4 倍,部分工作是为 GPU 编写定制软件。这些模型面向分子系统结构建模、类药物分子设计和基因突变影响预测等生物学科研任务,此前运行成本较高。Anthropic 表示将开源全部优化代码。
Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。
HeyGen 现可在 ChatGPT 和 Claude 中运行,让医生把已经写好的笔记直接转成整月的出诊视频,无需摄像机和额外时间。原文称医学是唯一一个最有发言权的专家却最没时间记录的职业。
Anthropic 的 Mike Krieger 表示,他如今在 Claude Desktop 上的大部分工作都在新式 Projects 中完成,可轻松并行启动多项任务,同时由协调者 Claude 快速响应。Omid Mogasemi 称该项目已开发数月,并成为他的新日常主力工具。
Mike Krieger 因难以想象 Dungeon Crawler Carl 中 Iron Tangle 关卡的整体结构,用 Claude 做了一个交互式 artifact(claude.ai/artifact/NTcG6…),他表示自己终于理解了这一关卡。该内容获得 36 个点赞、8213 次浏览。
Anthropic 开放生命科学验证计划(LSVP)申请,生命科学从业者可在新的防护措施下使用其模型,其中首次包含 Mythos。该计划以 beta 形式面向学术实验室、初创公司和药企等各类团队推出,官方称将持续改进并逐步扩展到个人 Pro 和 Max 订阅。申请与访问授权详情见 anthropic.com/news/life-scie。
Anthropic 的 ClaudeDevs 宣布在 Claude Code 桌面端和网页端推出 Projects,一个 project 即与 Claude 的一次对话,它会自行把工作拆成多个线程、以并行云会话运行并在其间传递上下文,用户离开后仍继续执行,目前面向部分用户 beta。
Anthropic 宣布与 Accenture 合作,对其前沿 AI 模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和安全防护措施测试。
基于 Claudian 改造的版本新增了对 antigravity cli 的支持,并可通过 OpenCodex 接入 Codex,同时该 Claudian 插件已可安装到 Obsidian 中使用。原推未披露模型版本、参数或性能数据。
太初团队开源 ZDTaichu5.0-9B 空间理解模型,结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器,支持文本、图片、视频输入,覆盖文档、图表、OCR 与视觉问答,并已提供权重、本地推理示例和适配的 vLLM 服务镜像。
Melissa Pan 在 Claude Code、Codex 和 Pi 上评测了 7 个模型,得出三点发现:harness 选择对任务成功率影响不大,但会显著影响成本;简单的 harness 也具竞争力;原生 harness 并不总是最佳选择。Harrison Chase 引用该结论指出,模型可能未必真正受益于原生 harness。
OpenAI 于 9 月 8 日称一个未发布的内部模型(能力显著强于 GPT-6 Astra)解决了 Navier–Stokes 存在性与光滑性问题,并公布了证明、预印本与 Lean 形式化文件。
Richard Ngo 提出用「有序疏散 vs 踩踏」类比 AI 发展:对齐难相当于门被卡住,而即使对齐本身不难,人群挤压冲向出口时开门也会难得多。他认为这一类比优于「军备竞赛」,并指出 AI 行业目前仍处「人群推搡前行、几乎无人重伤」的阶段,还有时间化解羊群心态。
Anthropic 的 Mike Krieger 宣布 Claude Cowork 和 Chat 从今天起合并为一个 Claude,原因是用户常不确定该从哪个产品入手。
Claude Cowork 与聊天功能合并为统一的 Claude,用户提出简短问题或交办一份报告后,Claude 会接手处理,即使合上笔记本也能继续,遇到不清楚的地方会主动询问,最终决定权仍归用户。
Anthropic 将 Claude Cowork 和聊天合并为一个 Claude,并接入 Claude Design,用户可直接让 Claude 生成 Slide、Design 或 Doc,无需切换标签页或应用。
Anthropic 的 Mike Krieger 表示,Claude Docs、Claude Slides 和 Claude Design 即日起在所有对话中可用,由改版后的 Artifacts 平台驱动。用户可以直接提出设计、演示文稿或文档需求,得到可编辑、可下载、可带走的结果。他邀请用户试用并反馈。
Anthropic 从今天起把 Claude Cowork 和 Chat 合并为一个统一的 Claude,先向 Pro 和 Max 用户在未来几周内逐步推送。官方称合并的原因是用户常不确定该从哪个产品入手,统一后由 Claude 自行决定实现路径,用户保留最终决定权,任务在关闭笔记本后仍可继续推进。
Anthropic 在学完互联网公开信息后,曾于 2021~2023 年下载数百万份盗版书,2023 年遭举报。因法律风险,其内部项目 Project Panama 改为满世界购买实体书,通过液压切割设备切掉书脊、拆成散页后送入工业扫描仪数字化,扫描完的书再交由外包垃圾回收供应商处理。这些通过中间机构购入的冷门、专业、学术书籍甚至古籍孤本,最终成为 Claude 的训练数据。
Anthropic 推出生命科学验证计划(LSVP),通过资质与伦理审查后,生命科学团队可在 Mythos、Opus、Sonnet 模型上获得对生物相关工作更宽松的保障设置,覆盖药物发现、研究生物学、临床开发等场景。
清华大学电子工程系博士、现苏黎世联邦理工学院博士后张托肯用 AI 在三天内从零设计了一颗 Attention 计算芯片并完成流片,过程记录在《三天从零到流片:AI 带我设计一颗 Attention 计算芯片》一文中。
Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。
Suhail 公开征集每天通过 OpenAI 或 Anthropic 的批量 API 请求处理超过 1B tokens 的用户,希望了解实现 batching 的利弊得失。感兴趣的开发者可通过私信与他交流,该推文发布时已获得 16 次转发和 65 个点赞。
Anthropic 的 Astra 上周成为按支出(美元花费)计算的榜首模型,OpenAI 的 Luna 则成为按 token 使用量计算的榜首模型,且领先幅度很大。这组对比显示,按钱包份额与按 token 份额衡量的模型排名出现分化。
Latent.Space 即将上线新一期节目,主题包括为何人们仍低估提示词、Claude Code Mods(昨日发布)以及前沿节奏。Thariq 刚完成录制,内容涉及此前较少谈及的技术细节。
LlamaIndex 分享了借助 Stainless 为 LlamaParse 生成并维护 SDK 的经验,指出每次 API 变更都会带来更新、测试和发布成本,而代码中暴露的不一致命名与 schema 也更难被忽视。Stainless 团队已加入 Anthropic,George He 和 Yong Park 撰文回顾了做对了什么、学到了什么,以及更换 SDK 生成器为何比预想更需谨慎。
Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。
a16z 投资的 AI 助理 Town 上线 3 个月,试用用户付费率超过 15%,传闻正洽谈约 10 亿美元估值的新融资。Town 要求用户先连接邮箱和日历才能使用,会按任务难度分配模型,大部分任务仍依赖前沿模型,为此公司每年为每位工程师投入至少 7.5 万美元购买 AI 工具。
Brian Chau 发推称,一家以色列 Effective Altruism 公司是 OpenAI、Anthropic 和 Meta 三起网络攻击的幕后推手,并称 @lumpenspace 参与协助。该推文附带长线程,获 278 次转发和 3984 次点赞。上述指控目前仅为该推文单方说法。
潮流周刊第 282 期以雾天上海照片为题,收录了把 iPhone Duo 合盖动效搬到 MacBook、敲机身或桌面触发 Mac 快捷键的工具、对比各销售地区 iPhone 差异的表格,以及 Dario 呼吁放慢 AI 迭代的相关内容。
腾讯云开发者文章梳理多项研究与官方工程实践,讨论 Agent 系统指令、Skill 与工具说明什么时候该补写、删减或按需加载,指出没有通用最佳长度。
金沙江创投朱啸虎在对话中判断,今年可能是基础大模型的最后一年,明年资本市场需要讲新故事,等Anthropic和国内大模型公司上完市,故事就讲得差不多了。他认为办公Agent肯定是大厂的天下,因为企业微信、飞书、钉钉掌握的组织关系与历史数据是创业公司难以逾越的上下文壁垒,创业公司只能选一家平台做垂直Agent。
腾讯技术工程发布长文,梳理 AI 工程从 Prompt Engineering 到 ReAct 再到 Context Engineering 的三阶段演进,并以 Anthropic《Effective Context Engineering for AI Agents》为主要参考构建实践体系。
「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。
Yann LeCun 回应称,Dario 早在 2019 年就声称 GPT-2 开源太危险,他当时就嘲讽过这一说法,并认为现在所有人都该嘲讽。
Sahil Lavingia 把自己所著《The Minimalist Entrepreneur》转化为 9 个 Claude Code 技能,并称这是他 star 数最多的 GitHub 仓库,已超过 10,000 stars。
GPT-6 Astra 是否会降维打击具身行业,成为这场圆桌讨论的核心问题之一。苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕数据来源(仿真与真机、Real-to-Sim)、模型路线、商业化落地指标(高成功率、客户持续付钱)以及被高估与低估的领域展开分歧讨论。
Anthropic CEO Dario Amodei 发新文《We Must Pace the Frontier》,主张 AI 行业应当放缓,并提出三部分计划,Anthropic 单方面承诺执行其中第一步:向第三方评估者提供永久、员工级别的系统访问权限,以核验安全措施执行、上报事故并在训练期间评估模型对齐情况。
针对当前 AI 实验室格局,@signulll 提出为何不直接取消 IPO 并把实验室国有化,让美国财政部成为唯一股东。该设想认为国有化可立即解决部分激励问题,由政府统一协调算力、模型发布、安全标准与节奏,无需竞争对手合谋。具体形式可参照联邦所有的战略技术公司,将 OpenAI、Anthropic 及后续指定的前沿实验室纳入其中,由总统任命董事会。
David Sacks 在回应中称,Sam Altman 与 Dario Amodei 已认同"放慢前沿"的说法,他认为按市场份额、收入增长和模型能力衡量,两家已在前沿智能上形成双头垄断,因此支持其自主决定放缓,但反对以反垄断豁免或监管审批为条件。Sacks 还质疑 METR 的独立性,称其与 Anthropic 的投资人和员工交织,并指出中国不太可能加入全球协议。