跳到正文
原文
Jan Leike(@janleike)· Jan Leike (@janleike)·· 2026-01-21AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Jan Leike:2025 年模型对齐程度显著提升,Anthropic、GDM 与 OpenAI 自动审计发现的不对齐行为比例均在下降

Interesting trend: models have been getting a lot more aligned over the course of 2025. The fractio...

AI 导读

Jan Leike 指出,2025 年模型对齐程度大幅提升,自动审计发现的不对齐行为比例不仅在 Anthropic 下降,在 GDM 和 OpenAI 也同样走低。

来源:Jan Leike(@janleike) · x.com