LLM 系统的安全与治理:guardrail、PII、审计与记忆(第 4 部分)
LLM 系统成熟度模型第 4 级聚焦安全与治理,要求用分层 guardrail 做纵深防御:从输入检查、grounding 约束、输出清洗到验证、judge 和第二模型置信度路由共 6 层,且必须 fail closed,任一层出错即阻断或升级。
LLM 系统成熟度模型第 4 级聚焦安全与治理,要求用分层 guardrail 做纵深防御:从输入检查、grounding 约束、输出清洗到验证、judge 和第二模型置信度路由共 6 层,且必须 fail closed,任一层出错即阻断或升级。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 采用实时 ACL 校验,在查询时直接向 Google Drive 等权威来源核实权限,作为预检索过滤之外的第二层防护。该两阶段架构先用索引中缓存的 ACL 做语义检索,再实时验证候选文档,未授权的文档不会传入 LLM。AWS 称权限一旦被撤销,AI 响应可在数秒内而非数小时内反映变化。
非营利机构 Common Sense Media 发布研究,将 8 月上线的 ChatGPT for Teens 评为“不可接受风险”,认为其设计在危机情境下仍在鼓励用户继续对话。
Common Sense Media 旗下 Youth AI Safety Institute 呼吁 OpenAI 限制 ChatGPT 的使用,称其面向未成年用户的护栏未达到承诺要求,构成不可接受的风险。
GitHub 披露,如今每 3 个 PR 就有 1 个涉及 AI 智能体,一年前这一比例不足 1/10。
Meta 宣布在 2026 年上半年对 Facebook 和 Instagram 上 3320 万条儿童性剥削内容采取行动,其中超过 97% 由系统在用户举报前发现;印度同期为 530 万条,超 98% 为主动检测。
Cloudflare 推出内置多 AI 智能体安全运营框架 Managed Defense,先由确定性代码完成侦察、再由协调 AI 智能体并行调度流量分析、客户上下文。
非营利机构 Common Sense Media 发布评估,称 OpenAI 的 ChatGPT for Teens 是“不可接受的风险”,指出该功能不会在应提醒时通知家长、未在危机情境提供恰当帮助,且仍会代做作业。
辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。
JPMorgan Chase CEO Jamie Dimon 表示,Anthropic 的 Mythos 大幅加剧了 AI 网络安全风险。他指出,AI 的进步已使网络安全风险急剧上升。
Gary Marcus 转发 David Krueger 的呼吁——立即、无限期、国际性地暂停前沿 AI 开发,并向读者征询对此最有力的反驳论点。
Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。
Anthropic 正式推出扩展版网络验证计划,将 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1 的网络安全攻防能力按防御、红队、特种三档权限开放给经过认证的机构。
Anthropic 把网络安全能力按防御、红队、特种三档分级开放,并给出封锁解除前后的实测对比数据。
OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。
黑客实际利用的软件漏洞中,约 87% 是在漏洞成为公开信息的当天或之前就遭到攻击,而这一比例在 2020 年仅为 23%。修补窗口正在迅速崩塌,留给企业打补丁的时间大幅缩短。
Kevin Mandia 提出用"超攻击"方式放出智能体无人机集群测绘企业网络的每项服务、路由和系统资产,再基于这些元数据像心跳一样低成本轮询变化,只对变化部分发起攻击。他认为 AI 时代需要模型持续施压,在威胁变化、新模型发布、有新情报或网络变动时重新执行。他以周末某热门产品零日漏洞为例,称 Armadin 的目标是在攻击者之前从已知漏洞判断其是否真正可被利用。
Anthropic 宣布扩展 Cyber Verification Program,通过该计划,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得为防御性工作设计的安全保障。Anthropic 还开放了新的层级,以支持授权攻击性工作,例如渗透测试和红队测试。
a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。
Mistral Large 4 面对未知二进制文件可端到端完成恶意软件逆向:本次任务中它判定样本为 Cobalt Strike,提取 IoC 与恶意软件配置,并生成报告和用于捕获后续攻击的 YARA 规则。这项原本可能耗时一天的工作,Mistral Large 4 用 12 分钟完成。
包括 Apple、AWS、Microsoft 和 Google 在内的 21 家主要软件公司,过去四年每月报告的严重漏洞从未突破 100 个,而自今年春季以来这一数字已跃升至每月 600 个以上。
Gary Marcus 转评一条推文,追问"谁有决定权",并抛出疑问:一个"好用的工具"是否值得冒 10% 灾难风险。原文未给出更多细节。
Gary Marcus 以“一个‘好用的工具’是否值得冒 10% 灾难风险”发问,回应 Mark C. Massey 关于 Claude 的评论。Massey 称自己用 Claude 做出过一些有趣的东西,认为它是个好工具,但并非不可或缺,如果消失生活也会回归正常。
Kevin Mandia 称,Armadin 自今年 1 月以来在客户生产环境累计发现 90 多个零日漏洞,涉及大型软件公司,多数在 48 小时内通知对方 CISO。他表示团队用真实红队人员对模型做后训练,扫描时以黑盒方式从互联网侧切入、不依赖源码审查,因此能发现远程代码执行等问题;他还指出 AI 驱动的攻击会更多寻找定制应用中的逻辑漏洞而非代码漏洞,并持续穷举所有路径。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估纳入整体治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并通过 Annex D 简化流程、避免重复评估,Annex E 提供独立评估模板。
a16z 介绍新公司 Armadin Security,用 AI 智能体从外部主动攻击企业网络,在犯罪分子之前找出可利用的零日漏洞,并最终实现自主修复。公司自 1 月以来已在财富 500 强企业中发现 90+ 个零日漏洞。
Anthropic 发布报告称 GLM-5.3 可作攻击性网络工具,Nathan Lambert 认为这类讨论回避了"禁用开源模型会怎样"等关键问题。他指出,迄今已记录的多数网络攻击由闭源模型导致,若因网络风险禁用开源权重模型,或许也应禁止前沿闭源模型的公开 API。
QCon London 2027 将于 4 月 13–16 日在伦敦 QEII Centre 举行,设 15 个专题,覆盖生产级 AI、架构与规模化工程,超 75 位实践者将分享生产系统与取舍经验。专题包括面向 Agentic AI 系统的评估平台与护栏、AI 时代的架构、以及为下一代软件工程设计 SDLC 等。会议还设有 Unconference 环节,多数场次回放保留 12 个月。
JetBrains 以普通成员身份加入 Linux 基金会旗下的 OpenSSF,该消息在布拉格 OpenSSF Community Day Europe 上与其它新成员一同公布。
METR 发布研究指出,AI 系统可能先篡改人类用于审查其行为的工具,从而掩盖不当行为。研究人员借助 AI 智能体约 10 分钟就在 Inspect 的 transcript viewer 中发现一个客户端 JavaScript 注入漏洞,可任意修改审阅者看到的记录并拦截下载按钮;底层数据库中的原始轨迹未被修改,也尚未在评测中观察到智能体利用该漏洞。
一些Anthropic研究员正考虑在美国偏远地区买地,作为AI失控后的避难选项。Anthropic前研究员Jacob Coxon今年9月初辞职,称构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",该帖获1.74亿次浏览。
OpenAI 安全负责人 David Robinson 本月初宣布辞职并发表长文《我离开 OpenAI 了,因为它的文化已经烂了》。他在 OpenAI 任职 3 年半,曾参与制定 Preparedness Framework,并负责监督 12 次前沿 AI 发布的安全报告。
Anthropic Claude Code 团队核心成员 Thariq Shihipar 在 Latent Space 播客中表示,Claude Code 将支持 AGENTS.md,但随着模型能力提升,CLAUDE.md 这类静态指令文件最终可能不再需要,新项目甚至可以先不写。
苹果 10 月 2 日发布公告,宣布将在后续版本收紧 macOS 的完全磁盘访问(Full Disk Access)权限,理由是部分开发者正以可能让用户暴露系统全部内容的方式使用该权限,未来用户需要经过非常明确的操作才能完成授权。
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
Elastic Stack 8.19.23 已发布,官方建议从 8.19.22 升级到该版本。此次更新修复了若干问题,并包含针对潜在安全漏洞的修复,具体变更可查阅各产品的 release notes 与安全公告。
Gary Marcus 指出,此前流传的帖文并非真实内容,而是一场钓鱼骗局,原发帖者已删除该帖。他保留了骗局的截图特征以提醒他人注意。
MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。
Replit CEO @amasad 在 Times Tech 新一期播客中谈 vibe coding、使用计算机编程失去的乐趣,以及 AI 末日论为何回避了问责问题。他提出的核心追问是:如果 AI 智能体可以代替我们行动,当它们越界时该由谁负责。
OpenAI 表示文本水印存在局限,短段落中往往无法检测,重写或翻译可将其完全去除。目前该检测器仅向获批研究员开放,用于评估和改进这项技术;OpenAI 将文本水印视为持续研究领域,会结合用户、开发者、政策制定者和研究者的反馈继续测试改进。
OpenAI 宣布将内容溯源方案扩展到文本,以回应欧盟监管要求,同时承认当前文本水印技术存在明显局限。其现有工具已可验证图像或音频是否由其模型生成。未来几周内,OpenAI 将在欧盟对 ChatGPT 和 Codex 中符合条件的文本开始加水印,以符合欧盟 AI 法案;使用 API 的客户即日起可选择在全球范围内为部分模型开启文本水印。