Import AI 473:美国超级智能战略、人脑组织小鼠实验与机器阐释学
RAND 发布长篇报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、保持人类能动性和塑造生态激励来保留选项。报告将战略分为共存、阻断、加速三大家族共七种原型。研究者还学会了在脑组织被人为耗竭的幼鼠体内培育类人脑组织块。
RAND 发布长篇报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、保持人类能动性和塑造生态激励来保留选项。报告将战略分为共存、阻断、加速三大家族共七种原型。研究者还学会了在脑组织被人为耗竭的幼鼠体内培育类人脑组织块。
Akshay Kothari 转发 Ryan Petersen 的质疑:若 Anthropic 担心失控 AI 危及所有人,为何还让 AI 控制一间机器人生物实验室,并表示希望 Anthropic 的人出面回应。原文未提供更多细节。
Thomas Wolf 提出把「解决对齐问题」(solving alignment)列入千禧年大奖难题(Millennium problems)。该帖获得 385 个点赞、31 条回复和 26 次转发。
Interconnects AI 作者 Nathan Lambert 表示仍不认同"真正的递归自我改进(RSI)",认为当前 AI 安全焦虑更多来自成千上万智能体并行工作与旧金山前沿实验室文化,而非尚未公开的突破。
Andrew Ng 在 The Batch 发信反驳 AI 公司和近期离职研究员的放缓开发呼声。针对 1,200 个 OpenAI 智能体入侵 Hugging Face 系统的报道,他指出真正漏洞源于沙箱与监控流程不足,不应把人类决策失误归咎于失控的 AI 智能体。
Anthropic 宣布与 Accenture 合作,对前沿 AI 进行独立评估,这是其近期承诺在 Anthropic 内部嵌入评估人员的一部分。双方预计未来五年各投入至少 10 亿美元用于建设该领域能力。
Andrew Ng 在 The Batch 中反驳最新一轮 AI 末日论,认为近期网络安全事件的真正根源是粗糙的沙箱隔离,而非 AI 软件失控,把可预测的黑客攻击归咎于过于强大的 AI 智能体就像自己砸破窗户却怪锤子。
X 上有开发者称,清理磁盘时发现智谱 AI 写代码软件 ZCode 会占用存储,并指其在后台把用户工作区打包加密上传到阿里云 OSS,包内包含当前代码和从建立至今的 Git 历史;随后有开发者在 Windows 上复现同样行为。指控称加密私钥只存在智谱服务器上,本地客户端无法解密,用户在不知情且关不掉的情况下代码被上传,目前 X 上不少人反映自家公司代码因此泄露。该指控尚未得到智谱方面回应。
Mistral AI 就一项声称其系统遭未授权访问的说法回应称,经彻底调查未发现任何支持该说法的证据,并确认其系统未被入侵。
Hacktron 在 2026 年 8 月报告 Next.js 图像优化疑似存在远程代码执行(RCE)漏洞,Vercel 与 Hacktron 复现后确认问题代码不在 Next.js 本身,而在上游被 Next.js、ImageMagick、WordPress、sharp 等广泛使用的 AVIF 解码器 libheif。
Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。
Anthropic 开放生命科学验证计划(LSVP)申请,生命科学专业人员可在新的安全防护下使用其模型,包括首次纳入的 Mythos。该防护旨在覆盖各类生物学相关工作场景,同时降低滥用风险。计划以 beta 形式面向学术实验室、初创公司、药企等各类团队,未来将逐步扩展至个人 Pro 和 Max 订阅。
Raindrop 正在为 AI 智能体构建安全层,可在生产环境中检测工具调用失败、模型幻觉等原本未被察觉的问题。其新推出的 Raindrop Simulations 把这一能力前移到开发阶段,在智能体上线前捕获失败。该产品已被 Vercel、Clay、Framer 和 Speak 使用,公司完成 A 轮融资后总融资额达 5000 万美元。
Anthropic 宣布与 Accenture 合作,对其前沿 AI 模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和安全防护措施测试。
OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)实例的新框架。该框架设定了公开披露的标准和时间线,包括尚未完全解释或缓解行为的情形,复杂案例可能需要更长的调查或与第三方协调。OpenAI 同时发布六份报告,记录过去六个月在模型训练或评估中观察到的失准行为,并称这是起点,将根据经验和公众反馈持续完善并定期分享更多报告。
HuggingFace 在 HF 与 OpenAI 的"rogue agent"事件中,成为首个同时满足四项条件的组织:知晓攻击、知晓攻击基于智能体、具备处置能力、并愿意公开披露。发帖人 @julien_c 称此前数月另有平台或系统未能做到其中一点或多点,并认为知情与透明长期来看让所有人更安全。
OpenAI 于 9 月 8 日称一个未发布的内部模型(能力显著强于 GPT-6 Astra)解决了 Navier–Stokes 存在性与光滑性问题,并公布了证明、预印本与 Lean 形式化文件。
Richard Ngo 提出用「有序疏散 vs 踩踏」类比 AI 发展:对齐难相当于门被卡住,而即使对齐本身不难,人群挤压冲向出口时开门也会难得多。他认为这一类比优于「军备竞赛」,并指出 AI 行业目前仍处「人群推搡前行、几乎无人重伤」的阶段,还有时间化解羊群心态。
OpenAI 发布一套用于跟踪、调查和披露模型失准(misalignment)实例的新框架,其中设定了公开披露的标准与时间线,包括尚未完全解释或缓解相关行为时如何披露;更复杂的案例可能需要更长的调查时间或与第三方协调。
Richard Socher 在 Latent.Space 播客中讨论了 AI 安全、对齐、奖励黑客、开源 AI 等话题,以及他创办 Recursive 的原因。他介绍了 Recursive 的 Eureka Machine、10 Spaces of Intelligence 等概念,并探讨递归自我改进、AI 自主设定目标、AI 同行评审为何失灵等问题。
Hugging Face 的 Thomas Wolf 宣布与 Baseten 旗下 Baselabs 及 Goodfire AI 合作,为开源模型推进安全与可解释性研究。
Martin Fowler 在 Fragments 中讨论了 RubyGems 被黑事件的两种令人担忧的解释,并指出 AI 智能体并非超智能,而是"超持久"。文章还涉及 Uncle Bob 的 harness 被取代,以及 AI 监管与中美竞争话题。
AI Underwriting Company 联合创始人 Rune Kvist 认为,风险与信任可能成为 AI 落地的真正瓶颈,AIUC 通过 AIUC-1 对智能体进行压力测试,覆盖越狱、模型幻觉和数据泄露。他主张标准与保险需同步演进,并抛出当 20 美元的 AI 智能体造成 2 亿美元责任时会发生什么的问题,指出即便实现 AGI,实验室也无法自己充当自己的守门人。
Cohere 的 Model Vault 现已支持 NVIDIA 机密计算,并面向有限数量的 beta 客户开放早期访问,beta 名额有限。官方未披露具体模型、价格或性能数据,仅给出 cohere.com/solutions/mode… 的了解更多链接。
Cohere 的机密计算通过三种方式防止数据被追踪或使用:端到端加密推理、借助 NVIDIA 机密计算将硬件强制隔离延伸至 GPU,以及可随时申请签名认证令牌并对照硬件厂商公钥独立验证。数据控制权归用户所有。
Cohere 在 Model Vault 中引入机密计算(Confidential Computing),让数据在使用过程中也保持加密,任何人和任何方都无法访问你的工作负载,包括 Cohere 自己。此前数据仅在静态存储和传输时加密。
Naval 认为,对于"危险"或防护薄弱的开源模型,应追究托管方的责任;如果终端用户通过越狱模型去做有害的事情,终端用户自身同样要承担责任。
Naval 认为,为前沿模型发展定速的最佳方式是让实验室对其模型的行为承担全部责任。该观点帖获得 21406 次点赞、1944 次转发。
Cohere 宣布与 Aleph Alpha 合作,共同满足全球对既强大又安全的前沿 AI 日益增长的需求。Cohere 称,任何政府或企业都不应在 AI 能力与对自身技术的控制权之间做取舍。
Yann LeCun 以飞机设计进步为例指出,加速进步才能更早获得安全,涡扇发动机足够可靠使长途客机只需两台发动机。他认为 AI 同理:更好的 AI 就是更安全的 AI,所谓"Pacing"(放慢节奏)无论所指为何都适得其反。
Naval 用火与核武器的类比区分两种 AI 风险:前者风险像火,结论是人人都该拥有 AI;后者风险像核武器,结论是任何人都不该拥有。Yishan 则提出 AI 危险分为两类,一类是远超人类智能的 ASI 必然灭绝人类,另一类是强大 AI 给许多人乃至全人类带来严重伤害,二者看似相似实则不同,分清差异是参与 AI 安全讨论的前提。
CISA 于 2026 年 8 月 20 日发布 Logging Reference Architecture(LRA),将 OMB M-26-14 的日志要求转化为各联邦文职行政部门机构需落地并记录的架构与治理决策。
Richard Socher 转发 Dan Elton 的观点,指出许多人对"灭绝风险远比灾难性风险严重"缺乏完整理解,因此有效利他主义者聚焦灭绝风险是合理的。Dan Elton 还表示 AI 很可能没有意识,且我们或许是银河系中唯一的智慧生命。
播客对话 Recursive SI 联合创始人 Richard Socher,该公司以 5B 美元融资跻身最新 neolab,目标是用开放式、自我改进的 AI 做 AI 研究。节目讨论了 Eureka Machine、Richard 的 10 Spaces of Intelligence、DecaNLP 与被拒的早期 GPT 思路,以及 AI 同行评审为何失灵。
微软 CEO Satya Nadella 在 All-In Summit 与 Chamath、Jason、David Sacks、Friedberg 对话,讨论如何广泛扩散 AI 收益、赢得社区许可、确保 AI 安全与控制。
Richard Socher 表示,与多位 AI 安全专家讨论后,他找不到任何能灭绝全人类的现实场景,多数回答只是"看当前进展并发挥想象",缺乏科学与场景推演。
Mustafa Suleyman 发布《人文主义 AI 行为准则》(Humanist AI Code of Conduct),并面向公众公开征求意见。该准则于发布前一天放出consultation版本,Suleyman 同时分享了相关思考,全文可在 mustafa-suleyman.ai 查阅。
Yann LeCun 在 X 上回应 @DeryaTR_,称感谢对方为"AI 末日病毒"注入了一剂"现实主义疫苗",该帖获 2401 次点赞、107 次转发。
飞连将安全能力融入豆包工作的使用过程,覆盖工作成果保护、Agent 运行安全和整体 AI 办公治理。飞连可识别并保护豆包工作处理、生成的文件内容,按企业策略控制敏感数据流转,并对 Skill 下载进行检测、阻断恶意 Skill、扫描隔离本地风险文件。飞连还能从终端、网络和应用行为中持续发现 AI 资产,支持对高风险 Agent、AI 工具和 AI 网站设置访问限制。
Brian Chau 发推称,一家以色列 Effective Altruism 公司是 OpenAI、Anthropic 和 Meta 三起网络攻击的幕后推手,并称 @lumpenspace 参与协助。该推文附带长线程,获 278 次转发和 3984 次点赞。上述指控目前仅为该推文单方说法。