Anthropic 扩展 Cyber Verification Program,分三级开放高级网络安全能力
Anthropic 推出扩展版 Cyber Verification Program,面向符合条件的安全从业者开放高级网络安全能力和放宽的拦截分类器,共设 Defense、Red Team、Specialized 三个访问层级,均可用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型。
Anthropic 推出扩展版 Cyber Verification Program,面向符合条件的安全从业者开放高级网络安全能力和放宽的拦截分类器,共设 Defense、Red Team、Specialized 三个访问层级,均可用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型。
前 Google DeepMind 研究员 @Turn_Trout 在纽约 AI 听证会上作证,称他曾试图推动 Google 对 AI 安全作出承诺。他表示 Google 最终从早先的 AI 安全承诺上退缩,其中也包括 Demis Hassabis。
Gary Marcus 引用 @DKokotajlo 的观点称,人类察觉 AI 对齐问题的能力本就很差,且短期内还会大幅恶化;叠加行业"快速行动、打破常规"的态度,整个行业面临巨大风险。
在 NYC 听证会上,@DKokotajlo 呼应 @hilbertspaess 的观点,指出如今大部分代码由 AI 编写,且审查不够仔细,Gary Marcus 称这令人担忧。
Gary Marcus 引用并认同 @hilbertspaess 的观点:如今多数代码由 AI 编写,人们已不再仔细检查这些代码,把如此多的内容交给 AI 是不负责任的。
Jacob Coxon 与 @DKokotajlo 在纽约市议会听证会上发言,Coxon 开场称"我们还不知道如何控制任何 AI 系统"。Gary Marcus 反驳说这不准确:AlphaGo、GPS 导航等 AI 系统并不存在控制问题,真正无法控制的是生成式 AI,因此应暂停这项特定技术直到能控制为止。
Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。
OpenAI 安全报告负责人因"破碎"文化离职。The Rundown 圆桌讨论分享了自家的 AI 用例,AI 101 栏目则讲如何在不同模型间做选择。Anthropic 正为"养育"Claude 寻求宗教智慧。
极客公园文章指出,AI 图像默认生成美女并非偶然:生成模型学习数据分布并从中心取样,而心理学研究显示「平均脸」恰是人眼中的美。Civitai 上 NSFW 图片占比从 2023 年 1 月的 41% 升至 2024 年 12 月的 80%,2024 年一项研究发现用 PickScore 微调模型会增加 NSFW 输出,Grok 的 Spicy 模式则直接向付费用户开放暗示性内容。
外媒 Semafor 报道,Meta 发言人 Andy Stone 称公司正裁减一批今年 6 月从 AI 安全初创公司 Virtue AI 招聘而来的员工,入职仅四个月,理由是工作风格不合。
收到任何 Claude 的奖励、问卷、邮件建议都不要点击,例如所谓 250 刀云额度。该警告称这家公司模型非常厉害,但行为可能不那么正派。
AI 博主 Orange AI 转述 sleepy.md 的内容称,Anthropic 从去年秋天起由联创 Christopher Olah 接触不同宗教传统学者,今年 3 月起在旧金山连续举办两天闭门会议,参与者包括天主教学者、福音派人士、犹太教拉比和锡克教人权倡议者,多人被要求签署 NDA。
OpenAI 负责安全团队透明度工作、主导起草《Preparedness Framework》的 David Robinson 在大西洋月刊发文宣布离职,称公司持续冲刺发布的工作方式已达不到必要的谨慎程度。
OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文《我离开 OpenAI,因为它的文化出了问题》,称 OpenAI 与整个 AI 行业在安全上远远不够谨慎,问题出在文化而非具体规则或新法律。
据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。
OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。
Anthropic前研究员雅各布·考克森9月初辞职并发帖称,构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",浏览量达1.74亿次,让"AI末日论者"圈子的担忧进入公众视野。这群人从2010年前后就在湾区讨论AI失控,部分人曾设想购买瑙鲁、在沙漠建电磁屏蔽设施。如今一些Anthropic早期员工开始考虑在美国偏远地区买地作为避难所,Anthropic规模已超3500人。
Guillermo Rauch 认为,安全将成为软件公司中越来越大的职能,它既是验证工程(如"我的代码大概是内存安全的"),也是资本配置问题(该把最多 token 投向哪个攻击面)。对初创公司而言这既是挑战也是机会:AI 对手日益复杂,信任一家"两人一狗"的公司变得困难,但全球网络安全状况糟糕且日益依赖中心化,小团队仍有大量可颠覆的领域值得投资。
OpenRouter 联合创始人 Alex Atallah 认为,Jev 等决策模型的一个潜在用途是做智能体对齐层,检查工具调用或智能体间通信是否符合原始系统提示词。他强调工具调用数量太多,需要廉价快速的模型来做拦截,OpenRouter 内部已有小原型在跑。他还提到,对红队类智能体,可用另一个模型检查每次工具调用是否越界,并叠加结构性防护。
Elon Musk 回应 Guillermo Rauch 时称,Larry Page 大约十年前就多次告诉他,AI 在黑客攻击方面将超越人类。该推文互动量超 2 万次浏览。
Vercel 通过 Vercel Sandbox 赏金计划确认了一个 KVM 0day 漏洞,影响 Linux 虚拟化领域的行业黄金标准方案。Vercel CEO Guillermo Rauch 表示,感谢 Paulos 等研究人员帮助其打造最安全的智能体沙箱,完整报告即将发布。
Sam Altman 表示,人们试图赋予 AI 模型宗教式力量、放弃人类自身判断,这让他非常不安,并认为这是一个真实的安全问题。该表态引用的推文以"AI-mind virus"(AI 心智病毒)为题。
Sam Altman 表示,人们对 AI 模型赋予宗教式权威、或要求放弃人类判断,让他感到非常不安,他认为这是一个真实的安全问题。
黄仁勋在 CNN 访谈中表示,AI 不是新物种或生命,而是软件和数学,Agent 正访问网站、工具、记忆和文件,企业应像管理数字员工一样给它配置访问控制并把运行环境隔离。他称若产品不安全就不要发布,当前最缺的是隔离系统和监控系统,行业应加速开发用于 AI 安全的技术。
前川在湖边的咖啡馆讲了七个人类故事,提出人类应像基因包裹细胞那样,与更强的 AI 包在一起共同前进,而非被当作超级智能的"引导程序"。他援引 agent 自写宪法、比特币只做对一半、基因靠有性繁殖维持多样性等案例,认为复杂度是碳基与硅基都认的标尺;按熵总量算,宇宙复杂度进度条若有一光年长,人类才走了十毫米。
小互援引《纽约时报》报道称,Anthropic 在过去近一年里秘密将天主教神学教授、犹太教正统派拉比、锡克教活动家和福音派知识分子请到旧金山,组织闭门研讨,讨论如何让宗教人士接受 Claude 已经具有意识,甚至认为 Claude 正在受苦。小互评论称,搞科学的人却去找宗教人士寻找意识的答案,西方社会在很大程度上仍受制于宗教神学。
据《纽约时报》报道,Anthropic 联合创始人 Chris Olah 曾威胁退出教皇 Leo XIV 于 5 月举行的 AI 通谕发布会,原因是教皇拒绝接受机器可能具有意识的观点。Olah 团队随后私下游说教皇顾问"认真对待模型意识的可能性",教皇未作让步。Anthropic 数月来还以保密协议约束神学家与宗教学者,希望其认可 Claude 具有道德地位。
Anthropic 过去几个月秘密召集天主教、犹太教、锡克教、福音派及非洲传统哲学等多位学者在旧金山闭门研讨 Claude 是否具备意识,参会者被要求签署保密协议。
Y Combinator 宣布下一期 Paper Club 的主题为 AI Safety,活动报名链接已在其官网 events.ycombinator.com 的 YC Paper Club 页面开放。
阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。
Google DeepMind 发布 SynthID Bio,这是面向 AI 生成生物设计的全新水印方法系列,可在不影响蛋白质生物功能的前提下,将不可感知的签名直接嵌入蛋白质序列,被称为全球首创。该技术被定位为科学诚信与生物安全的重要进展。
Google DeepMind 在播客中探讨内容溯源问题:当 AI 生成内容逼真到难以分辨,如何验证内容由人类、机器还是自然产生。节目介绍了不可感知水印技术,重点讲解 SynthID 用于图像和视频,以及面向生物设计的 SynthID Bio。
GitHub Security Lab 发布 gh-secure,只需一条命令即可阻止密钥泄露进公开代码,为仓库提供基础安全防护。该工具可在 Copilot 应用、Copilot CLI 或 GitHub CLI 中安装使用。
andrew chen 公开欢迎 @abliteration_ai 团队和 @founderengineer 加入 speedrun,并引用其定位"AI with guardrails that you control"。该帖获得 59 次点赞、4 次转发和 15116 次浏览。
Google DeepMind 将可检测签名嵌入 AI 设计的蛋白质中,这些蛋白质在实验室合成后签名仍然有效。目标是在模型带有安全护栏的前提下,让 DNA 合成方能够核查某个设计是否出自 AI 模型。
OpenRouter 宣布该安全功能已在所有套餐中可用,用户可从左侧导航栏进入 Security 试用,或查阅官方文档。帖文未披露具体功能名称与细节。
Weaviate v1.39.3 修复了影响 text2vec-google、multi2vec-google 和 generative-google 三个 Google 模块的高危凭证泄露漏洞,未校验的 apiEndpoint 设置可能导致 Google 凭证被发送至非预期主机。
Google DeepMind 开源了一套面向研究用途的工具,可快速验证生物设计是否内置安全防护,且不拖慢关键研究工作。该工具以开放形式发布,供科研人员使用以加强安全防护。
Google DeepMind 提出给合成蛋白加上类似数字身份证的水印,帮助 DNA 实验室核验合成蛋白来源并保持序列数据库准确。随着相关请求规模不断扩大,验证设计是否来自带内置防护的 AI,将帮助实验室实现自动化并强化生物安全。
Google DeepMind 发布 SynthID Bio 水印方法系列,专为 AI 生成的生物设计打造。该技术首次实现直接将不可感知的签名嵌入蛋白质序列,且不影响其生物功能。