跳到正文

#安全/对齐

今日 25 条
10月8日周四
  1. Stack Overflow BlogAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 系统的安全与治理:guardrail、PII、审计与记忆(第 4 部分)

    LLM 系统成熟度模型第 4 级聚焦安全与治理,要求用分层 guardrail 做纵深防御:从输入检查、grounding 约束、输出清洗到验证、judge 和第二模型置信度路由共 6 层,且必须 fail closed,任一层出错即阻断或升级。

  2. AWS Machine Learning BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amazon Quick 与 Amazon Bedrock 如何用实时 ACL 重塑 RAG 访问控制

    Amazon Quick 与 Amazon Bedrock Knowledge Bases 采用实时 ACL 校验,在查询时直接向 Google Drive 等权威来源核实权限,作为预检索过滤之外的第二层防护。该两阶段架构先用索引中缓存的 ACL 做语义检索,再实时验证候选文档,未授权的文档不会传入 LLM。AWS 称权限一旦被撤销,AI 响应可在数秒内而非数小时内反映变化。

  3. 技术前沿AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Common Sense Media 评测将 ChatGPT for Teens 评为不可接受风险,OpenAI 质疑其方法

    非营利机构 Common Sense Media 发布研究,将 8 月上线的 ChatGPT for Teens 评为“不可接受风险”,认为其设计在危机情境下仍在鼓励用户继续对话。

  4. 技术前沿AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Common Sense Media 称 OpenAI 的 ChatGPT 青少年版存在不可接受风险

    Common Sense Media 旗下 Youth AI Safety Institute 呼吁 OpenAI 限制 ChatGPT 的使用,称其面向未成年用户的护栏未达到承诺要求,构成不可接受的风险。

  5. The GitHub BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub:AI 智能体贡献三分之一 PR,密钥防泄露必须跟上代码生成速度

    GitHub 披露,如今每 3 个 PR 就有 1 个涉及 AI 智能体,一年前这一比例不足 1/10。

  6. 技术前沿AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 推出新 AI 工具,识别暗中导流儿童性虐待内容的广告

    Meta 宣布在 2026 年上半年对 Facebook 和 Instagram 上 3320 万条儿童性剥削内容采取行动,其中超过 97% 由系统在用户举报前发现;印度同期为 530 万条,超 98% 为主动检测。

  7. The Cloudflare BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 打造基于证据的多 AI 智能体安全运营框架

    Cloudflare 推出内置多 AI 智能体安全运营框架 Managed Defense,先由确定性代码完成侦察、再由协调 AI 智能体并行调度流量分析、客户上下文。

10月7日周三
  1. 技术前沿AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Common Sense Media 称 ChatGPT for Teens 存在不可接受风险,OpenAI 反驳其测试方法

    非营利机构 Common Sense Media 发布评估,称 OpenAI 的 ChatGPT for Teens 是“不可接受的风险”,指出该功能不会在应提醒时通知家长、未在危机情境提供恰当帮助,且仍会代做作业。

  2. 腾讯科技AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辛顿首次参与递归自我改进研究:AI已开始参与造AI,人类或只剩一两年准备监管

    辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。

  3. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JPMorgan CEO Jamie Dimon:Anthropic 的 Mythos 加剧了 AI 网络安全风险

    JPMorgan Chase CEO Jamie Dimon 表示,Anthropic 的 Mythos 大幅加剧了 AI 网络安全风险。他指出,AI 的进步已使网络安全风险急剧上升。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 转发 David Krueger 呼吁立即无限期国际暂停前沿 AI 开发,问反对论点是什么

    Gary Marcus 转发 David Krueger 的呼吁——立即、无限期、国际性地暂停前沿 AI 开发,并向读者征询对此最有力的反驳论点。

  5. Epoch AIAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 调查:美国成年人遭遇网络事件的比例与 Claude Fable 5 发布时相比没有变化

    Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。

  6. AI寒武纪AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出扩展版网络验证计划,向认证用户开放 Claude 攻防能力

    Anthropic 正式推出扩展版网络验证计划,将 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1 的网络安全攻防能力按防御、红队、特种三档权限开放给经过认证的机构。

    为什么值得看

    Anthropic 把网络安全能力按防御、红队、特种三档分级开放,并给出封锁解除前后的实测对比数据。

  7. a16z(@a16z)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈安全新循环:每发一个新模型就先打自己的系统

    OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。

  8. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    软件漏洞修补窗口正在崩塌:87% 被利用漏洞在公开当天或之前即遭攻击

    黑客实际利用的软件漏洞中,约 87% 是在漏洞成为公开信息的当天或之前就遭到攻击,而这一比例在 2020 年仅为 23%。修补窗口正在迅速崩塌,留给企业打补丁的时间大幅缩短。

  9. a16z(@a16z)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Mandia:企业需要像心跳一样轮询网络的智能体集群,Armadin 要在攻击者之前判断漏洞是否可利用

    Kevin Mandia 提出用"超攻击"方式放出智能体无人机集群测绘企业网络的每项服务、路由和系统资产,再基于这些元数据像心跳一样低成本轮询变化,只对变化部分发起攻击。他认为 AI 时代需要模型持续施压,在威胁变化、新模型发布、有新情报或网络变动时重新执行。他以周末某热门产品零日漏洞为例,称 Armadin 的目标是在攻击者之前从已知漏洞判断其是否真正可被利用。

  10. Anthropic(@AnthropicAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 扩展 Cyber Verification Program,向安全专业人员开放 Claude Mythos 5.1、Opus 5.5 与 Sonnet 5.5

    Anthropic 宣布扩展 Cyber Verification Program,通过该计划,经过验证的安全专业人员可以访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并获得为防御性工作设计的安全保障。Anthropic 还开放了新的层级,以支持授权攻击性工作,例如渗透测试和红队测试。

  11. a16z(@a16z)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Greg Brockman 谈 AI 找漏洞对防守方为何是伪装的好事

    a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。

  12. Mistral AI(@MistralAI)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 端到端逆向恶意软件样本,12 分钟判定为 Cobalt Strike

    Mistral Large 4 面对未知二进制文件可端到端完成恶意软件逆向:本次任务中它判定样本为 Cobalt Strike,提取 IoC 与恶意软件配置,并生成报告和用于捕获后续攻击的 YARA 规则。这项原本可能耗时一天的工作,Mistral Large 4 用 12 分钟完成。

  13. a16z(@a16z)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网络安全正迎来关键时刻:21 家软件巨头月度严重漏洞数从不足 100 跃升至 600 以上

    包括 Apple、AWS、Microsoft 和 Google 在内的 21 家主要软件公司,过去四年每月报告的严重漏洞从未突破 100 个,而自今年春季以来这一数字已跃升至每月 600 个以上。

  14. Gary Marcus(@GaryMarcus)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑:谁来拍板决定 AI 风险?

    Gary Marcus 转评一条推文,追问"谁有决定权",并抛出疑问:一个"好用的工具"是否值得冒 10% 灾难风险。原文未给出更多细节。

  15. Gary Marcus(@GaryMarcus)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 追问:一个“好用的工具”值得冒 10% 灾难风险吗?

    Gary Marcus 以“一个‘好用的工具’是否值得冒 10% 灾难风险”发问,回应 Mark C. Massey 关于 Claude 的评论。Massey 称自己用 Claude 做出过一些有趣的东西,认为它是个好工具,但并非不可或缺,如果消失生活也会回归正常。

  16. a16z(@a16z)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mandia:Armadin 年初至今在客户生产环境发现 90 多个零日漏洞

    Kevin Mandia 称,Armadin 自今年 1 月以来在客户生产环境累计发现 90 多个零日漏洞,涉及大型软件公司,多数在 48 小时内通知对方 CISO。他表示团队用真实红队人员对模型做后训练,扫描时以黑盒方式从互联网侧切入、不依赖源码审查,因此能发现远程代码执行等问题;他还指出 AI 驱动的攻击会更多寻找定制应用中的逻辑漏洞而非代码漏洞,并持续穷举所有路径。

10月6日周二
  1. AWS Machine Learning BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS 如何帮助客户对齐 ISO/IEC 42005:2025 负责任 AI 治理

    AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估纳入整体治理体系。该标准覆盖评估全生命周期(范围界定与执行、分析与报告、持续监控与复审),并通过 Annex D 简化流程、避免重复评估,Annex E 提供独立评估模板。

  2. a16z(@a16z)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Armadin Security 用 AI 智能体主动攻击企业网络,已发现 90+ 零日漏洞

    a16z 介绍新公司 Armadin Security,用 AI 智能体从外部主动攻击企业网络,在犯罪分子之前找出可利用的零日漏洞,并最终实现自主修复。公司自 1 月以来已在财富 500 强企业中发现 90+ 个零日漏洞。

  3. Interconnects AI — Nathan LambertAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么"开源模型危险、闭源模型安全"的网络安全叙事是错的

    Anthropic 发布报告称 GLM-5.3 可作攻击性网络工具,Nathan Lambert 认为这类讨论回避了"禁用开源模型会怎样"等关键问题。他指出,迄今已记录的多数网络攻击由闭源模型导致,若因网络风险禁用开源权重模型,或许也应禁止前沿闭源模型的公开 API。

  4. InfoQAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    QCon London 2027 公布 15 个专题,聚焦生产级 AI、架构与规模化工程

    QCon London 2027 将于 4 月 13–16 日在伦敦 QEII Centre 举行,设 15 个专题,覆盖生产级 AI、架构与规模化工程,超 75 位实践者将分享生产系统与取舍经验。专题包括面向 Agentic AI 系统的评估平台与护栏、AI 时代的架构、以及为下一代软件工程设计 SDLC 等。会议还设有 Unconference 环节,多数场次回放保留 12 个月。

  5. The JetBrains BlogAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 加入 Open Source Security Foundation

    JetBrains 以普通成员身份加入 Linux 基金会旗下的 OpenSSF,该消息在布拉格 OpenSSF Community Day Europe 上与其它新成员一同公布。

  6. METRAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:AI 系统可能掩盖自身不当行为

    METR 发布研究指出,AI 系统可能先篡改人类用于审查其行为的工具,从而掩盖不当行为。研究人员借助 AI 智能体约 10 分钟就在 Inspect 的 transcript viewer 中发现一个客户端 JavaScript 注入漏洞,可任意修改审阅者看到的记录并拦截下载按钮;底层数据库中的原始轨迹未被修改,也尚未在评测中观察到智能体利用该漏洞。

  7. 硅星人ProAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一群计划"逃离"湾区的Anthropic研究员:AI末日论者的避难所与40%接管概率

    一些Anthropic研究员正考虑在美国偏远地区买地,作为AI失控后的避难选项。Anthropic前研究员Jacob Coxon今年9月初辞职,称构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",该帖获1.74亿次浏览。

  8. CSDNAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 安全负责人 David Robinson 辞职,发长文批评公司文化已烂

    OpenAI 安全负责人 David Robinson 本月初宣布辞职并发表长文《我离开 OpenAI 了,因为它的文化已经烂了》。他在 OpenAI 任职 3 年半,曾参与制定 Preparedness Framework,并负责监督 12 次前沿 AI 发布的安全报告。

  9. InfoQ 中文AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程师谈 Claude Code 下一步:CLAUDE.md 最终会消失,Mods 可定制 harness

    Anthropic Claude Code 团队核心成员 Thariq Shihipar 在 Latent Space 播客中表示,Claude Code 将支持 AGENTS.md,但随着模型能力提升,CLAUDE.md 这类静态指令文件最终可能不再需要,新项目甚至可以先不写。

  10. 爱范儿AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果收紧 macOS 完全磁盘访问权限,Personal Agent 把风险带进了 Mac

    苹果 10 月 2 日发布公告,宣布将在后续版本收紧 macOS 的完全磁盘访问(Full Disk Access)权限,理由是部分开发者正以可能让用户暴露系统全部内容的方式使用该权限,未来用户需要经过非常明确的操作才能完成授权。

  11. SuperTechFansAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RemoveMacAI 开源工具可关闭 macOS 27 Apple Intelligence 并回收模型空间

    开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。

  12. Elastic BlogAI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic Stack 8.19.23 发布

    Elastic Stack 8.19.23 已发布,官方建议从 8.19.22 升级到该版本。此次更新修复了若干问题,并包含针对潜在安全漏洞的修复,具体变更可查阅各产品的 release notes 与安全公告。

  13. Gary Marcus(@GaryMarcus)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 澄清:网传内容实为钓鱼骗局,非真实信息

    Gary Marcus 指出,此前流传的帖文并非真实内容,而是一场钓鱼骗局,原发帖者已删除该帖。他保留了骗局的截图特征以提醒他人注意。

  14. lmarena.ai(@lmarena_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MTS Arena CEO 呼吁建立中立评估平台,OpenAI 与 Anthropic 不能自评模型安全

    MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。

  15. Replit ⠕(@Replit)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amasad 谈 vibe coding、编程乐趣与 AI 末日论的问责盲区

    Replit CEO @amasad 在 Times Tech 新一期播客中谈 vibe coding、使用计算机编程失去的乐趣,以及 AI 末日论为何回避了问责问题。他提出的核心追问是:如果 AI 智能体可以代替我们行动,当它们越界时该由谁负责。

  16. OpenAI(@OpenAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 回应文本水印局限:短文本难检测,改写翻译即可去除

    OpenAI 表示文本水印存在局限,短段落中往往无法检测,重写或翻译可将其完全去除。目前该检测器仅向获批研究员开放,用于评估和改进这项技术;OpenAI 将文本水印视为持续研究领域,会结合用户、开发者、政策制定者和研究者的反馈继续测试改进。

  17. OpenAI(@OpenAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 为符合欧盟 AI 法案将文本水印扩展至 ChatGPT 和 Codex

    OpenAI 宣布将内容溯源方案扩展到文本,以回应欧盟监管要求,同时承认当前文本水印技术存在明显局限。其现有工具已可验证图像或音频是否由其模型生成。未来几周内,OpenAI 将在欧盟对 ChatGPT 和 Codex 中符合条件的文本开始加水印,以符合欧盟 AI 法案;使用 API 的客户即日起可选择在全球范围内为部分模型开启文本水印。