Anthropic 新研究:Claude 能否自主对齐其他 AI
Anthropic 公布新 Fellows 研究,测试 Claude 能否自主完成对其他 AI 的对齐工作。研究给 Claude 48 小时和 1 块 GPU,让它自行调研并提出方法,再独立训练和测试小模型,Anthropic 称效果出乎意料地好。
Anthropic 公布新 Fellows 研究,测试 Claude 能否自主完成对其他 AI 的对齐工作。研究给 Claude 48 小时和 1 块 GPU,让它自行调研并提出方法,再独立训练和测试小模型,Anthropic 称效果出乎意料地好。
随着模型能力提升,网络攻击将更复杂,防御方采用技术的速度必须快于攻击方。Anton Osika 因此支持 OpenAI 发起的集体网络防御倡议。该公开信已获包括 Anthropic、AWS、Google、Microsoft、OpenAI 和 Oracle 在内的 100 多家组织签署。
Claude 博文《How Warp builds self-improving agents on Claude》介绍了终端工具 Warp 的内部实践:让 Agent 做代码审查时,问题不在于能力而在于缺少项目规范和历史经验的记忆,手动改系统提示词、完善 AGENTS.md 效果都不理想。
Stanford 联合全球科研机构专家发布 Terminal-Bench-Science,用于评估 AI 智能体在跨科学领域科研工作流中的表现,v0.1 版本包含 70 项任务。Claude Opus 5 在该基准上仅解出约 30%。该基准由 Terminal-Bench 团队打造,是一项持续进行的 Stanford 主导社区项目。
Anthropic 与 @hhmi_science 合作,Model Hardware Standard 由此诞生。推文附视频讲述该标准的起源故事,未披露具体技术细节或发布时间。
Anthropic 邀请科学、机器人、电子与制造领域的相关方加入 MHS 研究预览,共同参与标准制定。官方表示将携手行业伙伴推进 MHS,并随后面向开源社区开放。
Anthropic 表示,开源 MHS 之前还有更多需要学习的地方,原因是 LLM 从文本和图像中学习物理世界,仍缺乏物理直觉。该研究预览版将用于构建更多安全评估,并加强对 AI 在物理世界中应用的防护。
Anthropic 表示 MHS 目前对实验室与制造设备的覆盖最完善,不少开发者已用 Claude Code 操作开发板和摄像头等硬件。其研究预览将把 MHS 扩展到这些设备,使它们能在同一界面下工作。
Anthropic 启动 Model Hardware Standard(MHS)研究预览第一阶段,这是一项让 AI 智能体安全操作科研与先进制造中实体设备的新标准。更多细节见 anthropic.com/news/model-hardw。
AI 智能体在早期测试中使用 MHS 完成了多项实验:在 Genentech 实现带实时错误处理的药物发现实验,在 HHMI Janelia Research Campus 将成像实验从数周压缩到一天,并在 QuEra 的量子计算机上将激光稳定率从 58% 提升至 99.3%。
Anthropic 发布 MHS,将 AI 与硬件的定制集成从数天或数周压缩到数小时甚至数分钟,并提供统一接口让设备可被发现、让智能体安全操作设备。原文称此前没有让智能体安全操作设备的标准方式。
Anthropic、AWS、Google、Microsoft、OpenAI、Oracle 等 100 多家机构联署公开信,呼吁全球加大网络防御力度。信中主张以全球性行动应对网络安全威胁,联署方覆盖主要云厂商与 AI 公司。
AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。
Epoch AI 更新对 OpenAI 与 Anthropic 收入增长的追踪:OpenAI 过去一年收入 run rate 从 130 亿美元增至超 400 亿美元,Anthropic 2026 年第一季度 run rate 增长逾两倍,据报道 7 月底达 650 亿美元。
Gallup 基于 Amazon Bedrock 构建生成式 AI 助手 Gallup AI,将其 90 余年职场研究转化为实时个性化教练,直接嵌入 Gallup Access 应用。
SALT Lab 研究了人们如何与 AI 协作,发现其中超过一半的对话涉及"高影响任务"——即会影响他人或难以撤销的工作。该团队已在 alphaXiv 发布完整研究文章。
Anthropic 表示希望扩大其研究模型的规模,并面向研究人员开放工具申请,邀请从事目前无法完成的研究工作的人提交意向。申请通过 forms.gle 表单提交。
Anthropic 透露两项关于 Claude 的研究仍在进行:HIP Lab 正在研究 Claude 的行为与人们使用 AI 时感受之间的关系,METR 则在估算编程智能体带来的真实生产力增益。Anthropic 表示很快会分享这两项研究的更多内容。
Anthropic 首次向外部研究者提供研究 AI 影响的方式,所用数据来自真实且经过隐私保护的 Claude 使用数据。Anthropic 表示这类研究此前只能在 AI 实验室内部进行,并称无法独自讲清全部情况,因此开放了自家工具。
LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。
LangSmith LLM Gateway 进入公开 beta,作为位于 Agent 与模型之间的治理层,集中施加运行时控制。它支持组织、工作区、API key 和用户四级的限时支出上限与速率限制,命中上限时向 Agent 返回 402 响应;还可按自定义请求头识别终端客户,在多租户场景下用单个 API key 分别控制各客户的支出与速率。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
为符合 EU AI Act 等新法规,Anthropic 将在所有未来的 Claude 模型中嵌入不可见水印,并最终覆盖较旧的模型。文本生成方面,Claude 采用 Google 的 SynthID 方法,通过种子生成器引导词汇选择形成统计模式,再由评分 API 检测;图像方面则嵌入 C2PA 元数据。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
2026 年 FDE(前线部署工程师)被称为「硅谷最性感的工作」,全球岗位数量过去两年增长了几十倍,OpenAI、Anthropic 等公司纷纷组建 AI 部署团队帮客户解决落地「最后一公里」。
Ollama v0.33 发布,可将 Claude Desktop 配置为第三方网关提供方接入 Ollama,只需一个开关,云端与本地模型即可直接使用。该版本强调配置流程的简化,未披露更多技术细节。
Latent.Space 与 @realbasilchatha 合作推出新的 Forward Deployed Engineering 播客栏目。
Anthropic 员工 cat 表示,根据用户反馈,Claude 已在 Chat 和 Cowork 之间统一记忆,用户只需告诉 Claude 记住一次,该上下文就能跨界面使用。引用内容称 Claude 现在在 chat 与 Claude Cowork 共用一份记忆且由用户决定其内容,把任务交给 Cowork 时,它会从过往对话中已知的信息起步。
作者用 Claude Code 给字幕转录翻译 App BaoCut 加远程转录功能,把可行性分析、设计文档、高精度原型、编码、测试五个环节全部交给 Agent 执行,人只在关键节点确认和拍板。
AI 原生组织转型系列第一期提出,AI 不是组织的工具而是组织的替代品,应让 AI 接管对齐事实与对齐打法。作者认为知识工作约 60% 的时间耗在开会与协调上,局部提效动不了这个大头;AI 可把 N×N 沟通变成 N,并用 skill、检查点等方式把规范写进执行环境。文中列举出门问问、安克创新、Claude Tag、ZooClaw 等正在发生的做法。
Anthropic 宣布将为 Claude 模型的文本输出加水印,该水印对用户不可见,只有 Anthropic 能解码并判断文本是否由其模型生成。Sebastian Raschka 用 52 张幻灯片、48 分钟视频讲解了这一机制,并附有讲义文字稿,还讨论了水印可能失效或被移除的情况。
SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。
SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。
DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。
梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。
有观点认为,随着 AI 能力需回归 JavaScript / TypeScript 生产环境,前端开发者不必再先学 Python,可直接用 Anthropic 的 Claude Code 读代码库、写代码、调试并在终端跑工程级任务。文章称越来越多职位要求“能用 Claude Code 做前端工程化”,并借此推广一套 AI 算法就业课程,承诺未达 28W 年薪或涨幅低于 40% 全额退款。
Firecrawl 发布面向 Claude 的官方连接器,为 AI 智能体加入网络搜索能力,在 SimpleQA 上得分 94.7%。该连接器由其实时索引驱动,覆盖研究场景与开放网络,可提供更新鲜的结果,目前已在 Anthropic 连接器目录上线。
Anthropic 年化运行收入在 7 月底突破 650 亿美元,约为去年 12 月的 7 倍;Greg Brockman 称 OpenAI 该数字为 400 亿美元。据 Axios 报道,Anthropic 的 IPO 预计在 9 月或 10 月进行,摩根士丹利、高盛和摩根大通参与承销。
周天奕花四小时用 Claude 做出「同事.skill」,可读取飞书、钉钉、Slack、微信聊天记录及 Markdown 文档,把人的技术能力、沟通风格和决策习惯「蒸馏」成可调用的 AI 技能包,上线 5 天在 GitHub 收获 7.3k 星标、累计 23k,衍生出 200 多个 skills。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
商业客户端将 Harness 资产部署从单文件同步演进为 ACX 仓库整体插件化,提出「ACX 唯一事实源 + 三层资产治理 + 每日自动同步」方案,以应对多产品线、多 Agent、多台 Mac 本地部署带来的配置漂移与规则冲突。