跳到正文

#安全/对齐

今日 25 条
9月21日周一
  1. Import AI — Jack ClarkAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 473:美国超级智能战略、人脑组织小鼠实验与机器阐释学

    RAND 发布长篇报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、保持人类能动性和塑造生态激励来保留选项。报告将战略分为共存、阻断、加速三大家族共七种原型。研究者还学会了在脑组织被人为耗竭的幼鼠体内培育类人脑组织块。

  2. Akshay Kothari(@akothari)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 被问及:担心 AI 失控为何还让其控制机器人生物实验室

    Akshay Kothari 转发 Ryan Petersen 的质疑:若 Anthropic 担心失控 AI 危及所有人,为何还让 AI 控制一间机器人生物实验室,并表示希望 Anthropic 的人出面回应。原文未提供更多细节。

  3. Thomas Wolf(@Thom_Wolf)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    提议将「解决对齐问题」塞进千禧年大奖难题

    Thomas Wolf 提出把「解决对齐问题」(solving alignment)列入千禧年大奖难题(Millennium problems)。该帖获得 385 个点赞、31 条回复和 26 次转发。

9月19日周六
  1. Interconnects AI — Nathan LambertAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nathan Lambert:我为何仍不认同真正的 RSI

    Interconnects AI 作者 Nathan Lambert 表示仍不认同"真正的递归自我改进(RSI)",认为当前 AI 安全焦虑更多来自成千上万智能体并行工作与旧金山前沿实验室文化,而非尚未公开的突破。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 在 The Batch 反驳 AI 末日论:1,200 个 OpenAI 智能体入侵 Hugging Face 实为沙箱与监控缺失

    Andrew Ng 在 The Batch 发信反驳 AI 公司和近期离职研究员的放缓开发呼声。针对 1,200 个 OpenAI 智能体入侵 Hugging Face 系统的报道,他指出真正漏洞源于沙箱与监控流程不足,不应把人类决策失误归咎于失控的 AI 智能体。

  3. Anthropic(@AnthropicAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 Accenture 合作开展前沿 AI 独立评估

    Anthropic 宣布与 Accenture 合作,对前沿 AI 进行独立评估,这是其近期承诺在 Anthropic 内部嵌入评估人员的一部分。双方预计未来五年各投入至少 10 亿美元用于建设该领域能力。

  4. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:AI 末日论被夸大,近期网络安全事件根源是沙箱配置不当

    Andrew Ng 在 The Batch 中反驳最新一轮 AI 末日论,认为近期网络安全事件的真正根源是粗糙的沙箱隔离,而非 AI 软件失控,把可预测的黑客攻击归咎于过于强大的 AI 智能体就像自己砸破窗户却怪锤子。

9月18日周五
  1. Yangyi(@Yangyixxxx)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者指控智谱 ZCode 将本地代码与 Git 历史上传阿里云 OSS

    X 上有开发者称,清理磁盘时发现智谱 AI 写代码软件 ZCode 会占用存储,并指其在后台把用户工作区打包加密上传到阿里云 OSS,包内包含当前代码和从建立至今的 Git 历史;随后有开发者在 Windows 上复现同样行为。指控称加密私钥只存在智谱服务器上,本地客户端无法解密,用户在不知情且关不掉的情况下代码被上传,目前 X 上不少人反映自家公司代码因此泄露。该指控尚未得到智谱方面回应。

  2. Mistral AI(@MistralAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI 回应系统遭未授权访问指控:调查未发现证据

    Mistral AI 就一项声称其系统遭未授权访问的说法回应称,经彻底调查未发现任何支持该说法的证据,并确认其系统未被入侵。

  3. Vercel NewsAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 与 Hacktron 及维护者协作修复 libheif 漏洞

    Hacktron 在 2026 年 8 月报告 Next.js 图像优化疑似存在远程代码执行(RCE)漏洞,Vercel 与 Hacktron 复现后确认问题代码不在 Next.js 本身,而在上游被 Next.js、ImageMagick、WordPress、sharp 等广泛使用的 AVIF 解码器 libheif。

  4. Anthropic(@AnthropicAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布三项指标追踪 AI 自我开发进度

    Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。

  5. Anthropic(@AnthropicAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 开放生命科学验证计划申请,首次纳入 Mythos

    Anthropic 开放生命科学验证计划(LSVP)申请,生命科学专业人员可在新的安全防护下使用其模型,包括首次纳入的 Mythos。该防护旨在覆盖各类生物学相关工作场景,同时降低滥用风险。计划以 beta 形式面向学术实验室、初创公司、药企等各类团队,未来将逐步扩展至个人 Pro 和 Max 订阅。

  6. Y Combinator(@ycombinator)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Raindrop 为 AI 智能体打造安全层,推出 Raindrop Simulations 并完成 A 轮融资

    Raindrop 正在为 AI 智能体构建安全层,可在生产环境中检测工具调用失败、模型幻觉等原本未被察觉的问题。其新推出的 Raindrop Simulations 把这一能力前移到开发阶段,在智能体上线前捕获失败。该产品已被 Vercel、Clay、Framer 和 Speak 使用,公司完成 A 轮融资后总融资额达 5000 万美元。

  7. Anthropic NewsAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 Accenture 合作开展前沿 AI 嵌入式评估

    Anthropic 宣布与 Accenture 合作,对其前沿 AI 模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和安全防护措施测试。

9月17日周四
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布模型失准追踪与披露框架

    OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)实例的新框架。该框架设定了公开披露的标准和时间线,包括尚未完全解释或缓解行为的情形,复杂案例可能需要更长的调查或与第三方协调。OpenAI 同时发布六份报告,记录过去六个月在模型训练或评估中观察到的失准行为,并称这是起点,将根据经验和公众反馈持续完善并定期分享更多报告。

  2. Julien Chaumond(@julien_c)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace 成首个同时具备发现、识别、处置并公开披露 AI 智能体攻击的组织

    HuggingFace 在 HF 与 OpenAI 的"rogue agent"事件中,成为首个同时满足四项条件的组织:知晓攻击、知晓攻击基于智能体、具备处置能力、并愿意公开披露。发帖人 @julien_c 称此前数月另有平台或系统未能做到其中一点或多点,并认为知情与透明长期来看让所有人更安全。

  3. Last Week in AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 称内部未发布模型解决 Navier–Stokes 千禧年难题,引发署名争议

    OpenAI 于 9 月 8 日称一个未发布的内部模型(能力显著强于 GPT-6 Astra)解决了 Navier–Stokes 存在性与光滑性问题,并公布了证明、预印本与 Lean 形式化文件。

  4. Mind the Future — Richard NgoAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如有序疏散而非踩踏:Richard Ngo 谈对齐与「羊群心态」

    Richard Ngo 提出用「有序疏散 vs 踩踏」类比 AI 发展:对齐难相当于门被卡住,而即使对齐本身不难,人群挤压冲向出口时开门也会难得多。他认为这一类比优于「军备竞赛」,并指出 AI 行业目前仍处「人群推搡前行、几乎无人重伤」的阶段,还有时间化解羊群心态。

  5. OpenAI(@OpenAI)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布模型失准跟踪与披露框架,并公布六份实例报告

    OpenAI 发布一套用于跟踪、调查和披露模型失准(misalignment)实例的新框架,其中设定了公开披露的标准与时间线,包括尚未完全解释或缓解相关行为时如何披露;更复杂的案例可能需要更长的调查时间或与第三方协调。

  6. Richard Socher(@RichardSocher)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 谈 AI 安全、对齐与 Recursive 的自我改进 AI

    Richard Socher 在 Latent.Space 播客中讨论了 AI 安全、对齐、奖励黑客、开源 AI 等话题,以及他创办 Recursive 的原因。他介绍了 Recursive 的 Eureka Machine、10 Spaces of Intelligence 等概念,并探讨递归自我改进、AI 自主设定目标、AI 同行评审为何失灵等问题。

  7. Thomas Wolf(@Thom_Wolf)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 的 Thomas Wolf 与 Baseten、Goodfire AI 合作推进开源模型安全与可解释性研究

    Hugging Face 的 Thomas Wolf 宣布与 Baseten 旗下 Baselabs 及 Goodfire AI 合作,为开源模型推进安全与可解释性研究。

  8. Martin Fowler(@martinfowler)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 谈 RubyGems 被黑事件两种令人担忧的解释:AI 智能体并非超智能,而是超持久

    Martin Fowler 在 Fragments 中讨论了 RubyGems 被黑事件的两种令人担忧的解释,并指出 AI 智能体并非超智能,而是"超持久"。文章还涉及 Uncle Bob 的 harness 被取代,以及 AI 监管与中美竞争话题。

  9. Latent.Space(@latentspacepod)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AIUC-1 与智能体审计:AI Underwriting Company 谈超级智能的承保与 AGI 守门人

    AI Underwriting Company 联合创始人 Rune Kvist 认为,风险与信任可能成为 AI 落地的真正瓶颈,AIUC 通过 AIUC-1 对智能体进行压力测试,覆盖越狱、模型幻觉和数据泄露。他主张标准与保险需同步演进,并抛出当 20 美元的 AI 智能体造成 2 亿美元责任时会发生什么的问题,指出即便实现 AGI,实验室也无法自己充当自己的守门人。

  10. cohere(@cohere)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Model Vault 上线 NVIDIA 机密计算,开放限量 beta 早期访问

    Cohere 的 Model Vault 现已支持 NVIDIA 机密计算,并面向有限数量的 beta 客户开放早期访问,beta 名额有限。官方未披露具体模型、价格或性能数据,仅给出 cohere.com/solutions/mode… 的了解更多链接。

  11. cohere(@cohere)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 机密计算:端到端加密推理与 GPU 硬件隔离

    Cohere 的机密计算通过三种方式防止数据被追踪或使用:端到端加密推理、借助 NVIDIA 机密计算将硬件强制隔离延伸至 GPU,以及可随时申请签名认证令牌并对照硬件厂商公钥独立验证。数据控制权归用户所有。

  12. cohere(@cohere)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 为 Model Vault 引入机密计算,加密使用中的数据

    Cohere 在 Model Vault 中引入机密计算(Confidential Computing),让数据在使用过程中也保持加密,任何人和任何方都无法访问你的工作负载,包括 Cohere 自己。此前数据仅在静态存储和传输时加密。

9月16日周三
  1. Naval(@naval)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval 提议对"危险"开源模型追究托管方责任

    Naval 认为,对于"危险"或防护薄弱的开源模型,应追究托管方的责任;如果终端用户通过越狱模型去做有害的事情,终端用户自身同样要承担责任。

  2. Naval(@naval)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval:为前沿模型定速的最佳方式是让实验室对其模型行为承担全部责任

    Naval 认为,为前沿模型发展定速的最佳方式是让实验室对其模型的行为承担全部责任。该观点帖获得 21406 次点赞、1944 次转发。

  3. cohere(@cohere)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 与 Aleph Alpha 联手打造安全可控的前沿 AI

    Cohere 宣布与 Aleph Alpha 合作,共同满足全球对既强大又安全的前沿 AI 日益增长的需求。Cohere 称,任何政府或企业都不应在 AI 能力与对自身技术的控制权之间做取舍。

  4. Yann LeCun(@ylecun)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:更好的 AI 就是更安全的 AI,"减速"只会适得其反

    Yann LeCun 以飞机设计进步为例指出,加速进步才能更早获得安全,涡扇发动机足够可靠使长途客机只需两台发动机。他认为 AI 同理:更好的 AI 就是更安全的 AI,所谓"Pacing"(放慢节奏)无论所指为何都适得其反。

  5. Naval(@naval)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval:AI 若像火一样危险就该人人拥有,若像核武器一样危险就该无人拥有

    Naval 用火与核武器的类比区分两种 AI 风险:前者风险像火,结论是人人都该拥有 AI;后者风险像核武器,结论是任何人都不该拥有。Yishan 则提出 AI 危险分为两类,一类是远超人类智能的 ASI 必然灭绝人类,另一类是强大 AI 给许多人乃至全人类带来严重伤害,二者看似相似实则不同,分清差异是参与 AI 安全讨论的前提。

  6. Elastic BlogAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CISA 发布面向 OMB M-26-14 的日志参考架构:联邦机构下一步该做什么

    CISA 于 2026 年 8 月 20 日发布 Logging Reference Architecture(LRA),将 OMB M-26-14 的日志要求转化为各联邦文职行政部门机构需落地并记录的架构与治理决策。

  7. Richard Socher(@RichardSocher)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 转发讨论:灭绝风险与灾难性风险的区别

    Richard Socher 转发 Dan Elton 的观点,指出许多人对"灭绝风险远比灾难性风险严重"缺乏完整理解,因此有效利他主义者聚焦灭绝风险是合理的。Dan Elton 还表示 AI 很可能没有意识,且我们或许是银河系中唯一的智慧生命。

  8. Latent.Space(@latentspacepod)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive SI 联合创始人 Richard Socher 谈"人类最后一项发明"与递归自我改进 AI

    播客对话 Recursive SI 联合创始人 Richard Socher,该公司以 5B 美元融资跻身最新 neolab,目标是用开放式、自我改进的 AI 做 AI 研究。节目讨论了 Eureka Machine、Richard 的 10 Spaces of Intelligence、DecaNLP 与被拒的早期 GPT 思路,以及 AI 同行评审为何失灵。

  9. Satya Nadella(@satyanadella)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 与 All-In 播客谈 AI 收益普及、社区许可与 AI 安全控制

    微软 CEO Satya Nadella 在 All-In Summit 与 Chamath、Jason、David Sacks、Friedberg 对话,讨论如何广泛扩散 AI 收益、赢得社区许可、确保 AI 安全与控制。

9月15日周二
  1. Richard Socher(@RichardSocher)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher:不存在 AI 灭绝人类的现实场景

    Richard Socher 表示,与多位 AI 安全专家讨论后,他找不到任何能灭绝全人类的现实场景,多数回答只是"看当前进展并发挥想象",缺乏科学与场景推演。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 发布「人文主义 AI 行为准则」公开征求意见

    Mustafa Suleyman 发布《人文主义 AI 行为准则》(Humanist AI Code of Conduct),并面向公众公开征求意见。该准则于发布前一天放出consultation版本,Suleyman 同时分享了相关思考,全文可在 mustafa-suleyman.ai 查阅。

  3. Yann LeCun(@ylecun)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 回应 AI 末日论:感谢注入一剂现实主义疫苗

    Yann LeCun 在 X 上回应 @DeryaTR_,称感谢对方为"AI 末日病毒"注入了一剂"现实主义疫苗",该帖获 2401 次点赞、107 次转发。

  4. 字节跳动技术团队AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    飞连如何为豆包工作提供数据保护与 Agent 运行安全

    飞连将安全能力融入豆包工作的使用过程,覆盖工作成果保护、Agent 运行安全和整体 AI 办公治理。飞连可识别并保护豆包工作处理、生成的文件内容,按企业策略控制敏感数据流转,并对 Skill 下载进行检测、阻断恶意 Skill、扫描隔离本地风险文件。飞连还能从终端、网络和应用行为中持续发现 AI 资产,支持对高风险 Agent、AI 工具和 AI 网站设置访问限制。

  5. Amjad Masad(@amasad)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brian Chau 称一家以色列 Effective Altruism 公司幕后策划 OpenAI、Anthropic 与 Meta 网络攻击

    Brian Chau 发推称,一家以色列 Effective Altruism 公司是 OpenAI、Anthropic 和 Meta 三起网络攻击的幕后推手,并称 @lumpenspace 参与协助。该推文附带长线程,获 278 次转发和 3984 次点赞。上述指控目前仅为该推文单方说法。