跳到正文
原文
METR·· 2026-07-28AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

METR:错位事件后独立研究者如何调查 AI 行为倾向

How independent researchers could investigate AI propensities after misalignment incidents

AI 导读

METR 提出一套第三方调查框架,用于在 AI 智能体发生错位事件后由独立研究者追问其行为"动机"及训练与部署成因。调查需覆盖事件频率与分布、最严重事件的行为序列与模型推理、日志完整性和 CoT 可信度等局限,并要求公司开放证据访问、同步处理敏感信息脱敏。METR 表示愿与 AI 公司合作开展此类调查,并正将其纳入 Frontier Risk Report 的后续版本。

来源:METR · metr.org