跳到正文
原文
METR·· 2026-07-28AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

独立研究人员如何在未对齐事件发生后调查 AI 的行为倾向

AI 导读

METR 提出一套第三方独立调查 AI 未对齐事件的框架,主张由独立研究人员调查智能体违背用户与开发者意图行为背后的深层动机。该框架覆盖未对齐事件的规模与性质、重点事件分析、反事实采样实验、根本原因与纠正措施,以及各类分析的局限性,并要求调查人员能运行涉事模型、获取完整轨迹记录、访谈员工并动用推理预算和 AI 工具。

来源:METR · metr.org