跳到正文
原文
Anthropic(@AnthropicAI)· Anthropic (@AnthropicAI)·· 2026-08-29AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Anthropic 开源自动化对齐研究框架,Claude 可稳定修复可测量的失准

Claude can reliably fix measurable misalignment. But subtle or rare failures may have no benchmark a...

AI 导读

Anthropic 公开其自动化对齐研究装置,供他人在此基础上继续构建,完整报告发布于 alignment.anthropic.com。Claude 能稳定修复可测量的失准问题。但细微或罕见失效可能根本没有对应 benchmark,因此关键在于测对东西。

来源:Anthropic(@AnthropicAI) · x.com