跳到正文
原文
Anthropic(@AnthropicAI)· Anthropic (@AnthropicAI)·· 2026-08-29AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Anthropic 测试 Sonnet 5 能否对齐更强的 Opus 4.8

Could a model one day align its stronger successors? As a first test, we had Sonnet 5 post-train a...

AI 导读

Anthropic 把“模型能否对齐比自身更强的后继模型”作为首个测试:让 Sonnet 5 对 Opus 4.8 的一个早期 checkpoint 做后训练。该检查点最终达到的安全分数接近经过完整对齐训练的正式版 Opus 4.8。

来源:Anthropic(@AnthropicAI) · x.com