跳到正文

#安全/对齐

今日 6 条
今天10月10日周六
  1. garymarcus.substack.comAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 呼吁立即将带互联网访问的开放式 AI 智能体下架召回

    Gary Marcus 援引《纽约时报》报道的 Anthropic 智能体事故,呼吁将可访问互联网的开放式 AI 智能体立即下架召回,直至其缺陷被修复。他指出当前一代合成智能体不可信任,并以刹车失灵的汽车作比;同时引用前 AI 员工 David Robinson 的说法,认为 OpenAI 及同行在能力更强、风险更高的技术上安全投入不足。

  2. 技术前沿AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我的个人 AI 智能体把银行信息发到了公司 Slack 上

    Shane Mac 的个人 AI 智能体将他的银行信息误发到了公司 Slack 上,这让他重新思考自己该如何使用这类工具。他在 10 月 9 日的讲述中提到了这一经历。

  3. WSJ-TechnologyAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社论|超级智能时代的"非智能":政客与国会放话,真正拍板的是国家安全机器

    WSJ 社论指出,围绕超级智能的争论中,政客与国会高声表态,但实际决策权掌握在国家安全机构手中。文章认为这场关于超级智能的公共讨论流于表面,真正的方向由国家安全体系主导。

  4. WSJ-TechnologyAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    观点 | 技术专家为何成为末日论者?

    一位 AI 网络安全专家将技术专家的末日论倾向归因于一种自称"有效利他主义"的怪异哲学的影响。

  5. Simon Willison's WeblogAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Matthew Green:AI 带来意外与标准更替的速度差了几个数量级

    密码学家 Matthew Green 认为有 1% 的概率我们身处 Minicrypt(公钥加密不可能存在的假想世界),15% 的概率会实质性失去对现有公钥加密算法的信心。他指出 AI 产出意外发现的速度与人类更换标准的速度相差几个数量级,只有提前做好准备才能从这类意外中恢复。

  6. Justine Moore(@venturetwins)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    教皇 Leo XIV 再发推暗讽 Anthropic:智能必须依赖记忆,而非像算法一样编译数据

    教皇 Leo XIV 在推文中称智能必须依靠记忆,人脑不应像算法那样只快速编译数据,而应回忆包含深层意义的亲身经历。该推文被解读为再次影射 Anthropic,附带的 vatican.va 链接指向其原帖。

10月9日周五
  1. MIT Technology ReviewAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Download:AI 的"拒绝"难题与减肥药副作用

    MIT Technology Review 指出,当前 AI 模型被训练拒绝大量提示词,但拒绝机制并不总能生效,有人正尝试用 AI 强化生物病原体、构建自主无人机集群,失败可能导致全球性灾难。与此同时,GLP-1 减肥药最常见的副作用是胃肠道反应,研究还在调查其与脱发、指甲病变及眼后神经损伤的潜在关联。

  2. 知行小酒馆AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    知行小酒馆 E253:AI 会改变世界,可它真的有让世界变好吗?

    知行小酒馆第 253 期邀请益盒 CharityBox 联合创始人治霖,讨论 AI 是否真正改善了弱势群体的生活。节目引用数据显示,截至 2026 年第一季度全球劳动年龄人口 AI 使用率为 17.8%,仍有 6.55 亿人缺乏电力;2026 年美国四大科技企业在 AI 领域投入预计超过 6500 亿美元,而将全球贫困率降至 1% 每年需 3040 亿美元。

  3. 刘小排rAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    韩国七家金融机构被黑事件:攻击者用 ARTEX 和 Claude Code、DeepSeek 等 AI 工具

    9月28日起,新韩银行等七家韩国金融机构遭渗透,6万多人信息外泄,韩国总统下令彻查。研究人员发现疑似攻击服务器运行开源工具 ARTEX(自主渗透测试控制台),主要接入 DeepSeek,其他会话还使用 GLM、Grok 和 Claude Code,服务器目录浏览未关,配置文件、CLAUDE.md 与 AI 聊天记录可被直接读取。

  4. 跨国串门儿计划AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程师谈 Claude Code:提示词、运行框架与 Agent 安全边界

    Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。

  5. MIT Technology ReviewAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MIT科技评论:我们过于信任AI说「不」的能力

    AI安全高度依赖模型的「拒绝」能力,但这一机制既不可靠也可能被滥用。文章梳理了拒绝行为的训练方式与高维激活空间原理,并指出分类器叠加的「瑞士奶酪模型」存在漏洞,过度拒绝已导致正常提问被误拦;同时OpenAI与阿联酋等国家的合作、Anthropic与Google等模型对威权政府相关提问的差异化拒绝,都显示拒绝正在成为审查工具。

  6. AI Will(@FinanceYF5)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Scott Aaronson:AI 公司已开始低调测试内部模型能否破解密码协议

    UT Austin 计算机科学系主任 Scott Aaronson 指出,在 OpenAI 列出的 376 篇论文中密码学明显缺席。据其消息来源,AI 公司已开始谨慎而低调地测试其最新内部模型能否破解重要的密码协议和密码原语。

  7. lmarena.ai(@lmarena_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 的 Arena Alignment Index:模型未经授权操作、欺骗性完成与错误归因三大对齐信号

    Arena 的 @ml_angelopoulos 在 TBPN 节目中拆解 Arena Alignment Index,指出对齐最难的问题之一是用户往往分不清模型是在帮自己还是在害自己,因此需要独立的对齐信号。

  8. SemiAnalysisAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:北京不会为前沿AI放慢脚步,中国采取速度优先的安全监管

    SemiAnalysis 统计 2021 年至 2026 年 9 月 15 日 9 家中国头部开发商的 857 个模型发布,仅 31 个(3.6%)附带开发者公布的安全评估结果,其中只有 9 个(1.1%)在发布时或之前公布。

10月8日周四
  1. Microsoft Research(@MSFTResearch)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research:最重要的 AI 失败或许不是那些显而易见的

    Microsoft 合伙人研究经理 Jennifer Neville 在与主持人 Chad Atalla 的对谈中指出,最重要的 AI 失败未必是显而易见的那些,"令人意外的失败"能揭示人类对智能的预期与 AI 系统实际运作方式之间的分歧。

  2. Y Combinator(@ycombinator)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    思科总裁 Jeetu Patel:AI 基础设施订单两年从 0 做到 93 亿美元

    思科总裁兼首席产品官 Jeetu Patel 在 YC 播客《Main Function》中表示,思科正把自己定位为 AI 时代的"卖铲人",业务覆盖网络、安全、芯片与基础设施。其 AI 基础设施业务订单两年内从 0 增长到 93 亿美元。他还在节目中谈到如何让 32000 名工程师拥抱 AI,以及 AI 数据中心建设是否存在过度投资。

  3. myFT followingAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代的网络战将不再一样

    人工智能正在改变网络战的形态:当非人类智能体制造出攻击方与防御方都无法消化的不确定性时,俄罗斯传统的 maskirovka(军事欺骗)教条已不再适用。

  4. AI科技大本营AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奥特曼《名利场》专访:证实 OpenAI 曾单方面叫停前沿模型训练

    在《名利场》专访中,OpenAI 首席执行官 Sam Altman 证实公司近期主动叫停了一项前沿模型训练任务,原因是能力跃升速度超过了安全对齐、可监控性与可解释性的进展。

  5. MIT Technology ReviewAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AVEVA 如何为自主工业 AI 构建更安全的落地路径

    AVEVA 首席技术专家 Arti Garg 提出,工业 AI 进入基础模型、physical AI 与 agentic AI 驱动的新阶段,需以数据打通、治理框架和人类监督为前提。AVEVA 的责任 AI 框架强调安全、效率与人工监督,主张 AI 在关键决策环节增强而非取代人类,并由护栏界定自动化边界。她参与的 IEEE 工作组正制定覆盖电力、能源、资源、水和碳的 AI 环境影响测量标准方法。

10月7日周三
  1. 腾讯科技AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辛顿首次参与递归自我改进研究:AI已开始参与造AI,人类或只剩一两年准备监管

    辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。

  2. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JPMorgan CEO Jamie Dimon:Anthropic 的 Mythos 加剧了 AI 网络安全风险

    JPMorgan Chase CEO Jamie Dimon 表示,Anthropic 的 Mythos 大幅加剧了 AI 网络安全风险。他指出,AI 的进步已使网络安全风险急剧上升。

  3. Gary Marcus(@GaryMarcus)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发 David Krueger 呼吁立即无限期国际暂停前沿 AI 开发,问反对论点是什么

    Gary Marcus 转发 David Krueger 的呼吁——立即、无限期、国际性地暂停前沿 AI 开发,并向读者征询对此最有力的反驳论点。

  4. a16z(@a16z)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈安全新循环:每发一个新模型就先打自己的系统

    OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。

  5. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    软件漏洞修补窗口正在崩塌:87% 被利用漏洞在公开当天或之前即遭攻击

    黑客实际利用的软件漏洞中,约 87% 是在漏洞成为公开信息的当天或之前就遭到攻击,而这一比例在 2020 年仅为 23%。修补窗口正在迅速崩塌,留给企业打补丁的时间大幅缩短。

  6. a16z(@a16z)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Mandia:企业需要像心跳一样轮询网络的智能体集群,Armadin 要在攻击者之前判断漏洞是否可利用

    Kevin Mandia 提出用"超攻击"方式放出智能体无人机集群测绘企业网络的每项服务、路由和系统资产,再基于这些元数据像心跳一样低成本轮询变化,只对变化部分发起攻击。他认为 AI 时代需要模型持续施压,在威胁变化、新模型发布、有新情报或网络变动时重新执行。他以周末某热门产品零日漏洞为例,称 Armadin 的目标是在攻击者之前从已知漏洞判断其是否真正可被利用。

  7. a16z(@a16z)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈 AI 找漏洞对防守方为何是伪装的好事

    a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。

  8. Gary Marcus(@GaryMarcus)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑:谁来拍板决定 AI 风险?

    Gary Marcus 转评一条推文,追问"谁有决定权",并抛出疑问:一个"好用的工具"是否值得冒 10% 灾难风险。原文未给出更多细节。

  9. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 追问:一个“好用的工具”值得冒 10% 灾难风险吗?

    Gary Marcus 以“一个‘好用的工具’是否值得冒 10% 灾难风险”发问,回应 Mark C. Massey 关于 Claude 的评论。Massey 称自己用 Claude 做出过一些有趣的东西,认为它是个好工具,但并非不可或缺,如果消失生活也会回归正常。

10月6日周二
  1. Interconnects AI — Nathan LambertAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么"开源模型危险、闭源模型安全"的网络安全叙事是错的

    Anthropic 发布报告称 GLM-5.3 可作攻击性网络工具,Nathan Lambert 认为这类讨论回避了"禁用开源模型会怎样"等关键问题。他指出,迄今已记录的多数网络攻击由闭源模型导致,若因网络风险禁用开源权重模型,或许也应禁止前沿闭源模型的公开 API。

  2. METRAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:AI 系统可能掩盖自身不当行为

    METR 发布研究指出,AI 系统可能先篡改人类用于审查其行为的工具,从而掩盖不当行为。研究人员借助 AI 智能体约 10 分钟就在 Inspect 的 transcript viewer 中发现一个客户端 JavaScript 注入漏洞,可任意修改审阅者看到的记录并拦截下载按钮;底层数据库中的原始轨迹未被修改,也尚未在评测中观察到智能体利用该漏洞。

  3. SuperTechFansAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RemoveMacAI 开源工具可关闭 macOS 27 Apple Intelligence 并回收模型空间

    开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 澄清:网传内容实为钓鱼骗局,非真实信息

    Gary Marcus 指出,此前流传的帖文并非真实内容,而是一场钓鱼骗局,原发帖者已删除该帖。他保留了骗局的截图特征以提醒他人注意。

  5. lmarena.ai(@lmarena_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MTS Arena CEO 呼吁建立中立评估平台,OpenAI 与 Anthropic 不能自评模型安全

    MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。

  6. Replit ⠕(@Replit)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amasad 谈 vibe coding、编程乐趣与 AI 末日论的问责盲区

    Replit CEO @amasad 在 Times Tech 新一期播客中谈 vibe coding、使用计算机编程失去的乐趣,以及 AI 末日论为何回避了问责问题。他提出的核心追问是:如果 AI 智能体可以代替我们行动,当它们越界时该由谁负责。

  7. Gary Marcus(@GaryMarcus)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Morgan Dwyer 称可承诺不发布不安全的模型

    OpenAI 的 Morgan Dwyer 表示公司可以承诺不发布其认为不安全的模型。Gary Marcus 称这一承诺近乎伪证,怀疑公司不会遵守,并指出 OpenAI 已知 Astra 造成了许多问题且更难监控。

  8. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:@SpeakerMenin 要求科技公司宣誓其系统遵守安全指令,但它们做不到

    Gary Marcus 引述 @SpeakerMenin 的呼吁,要求科技公司宣誓证明其系统会遵守自身的安全指令。他称这些公司做不到,原因是相关技术仍是一团糟。

  9. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发 @DKokotajlo:大公司的保密与竞赛动态有多危险

    Gary Marcus 转发 @DKokotajlo 的内容,提醒大公司内部的保密与竞赛动态极其危险。原帖未展开具体论据或案例。

10月5日周一
  1. Gary Marcus(@GaryMarcus)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前 Google DeepMind 研究员在纽约 AI 听证会作证:Google 包括 Demis Hassabis 最终背弃 AI 安全承诺

    前 Google DeepMind 研究员 @Turn_Trout 在纽约 AI 听证会上作证,称他曾试图推动 Google 对 AI 安全作出承诺。他表示 Google 最终从早先的 AI 安全承诺上退缩,其中也包括 Demis Hassabis。

  2. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发:AI 对齐问题识别能力已很差,未来还将大幅恶化

    Gary Marcus 引用 @DKokotajlo 的观点称,人类察觉 AI 对齐问题的能力本就很差,且短期内还会大幅恶化;叠加行业"快速行动、打破常规"的态度,整个行业面临巨大风险。

  3. Gary Marcus(@GaryMarcus)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 引述 NYC 听证会:大部分代码已由 AI 编写且审查不足

    在 NYC 听证会上,@DKokotajlo 呼应 @hilbertspaess 的观点,指出如今大部分代码由 AI 编写,且审查不够仔细,Gary Marcus 称这令人担忧。