跳到正文
原文
Stanford AI Lab(@StanfordAILab)· Stanford AI Lab (@StanfordAILab)·· 2026-07-06AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

ICML 2026 论文:LLM 预测其他模型回答的准确率高于预测事实真相

LLMs are better at predicting what other models will say than what’s actually true. When they’re wro...

AI 导读

在 ICML 2026 论文《Truthfulness Does Not Scale Like Reasoning》中,研究者发现 LLM 预测其他模型会说什么的准确率高于预测事实真相,且模型犯错时会"一起犯错",因此通过多次采样投票无法恢复真相。Pass@k 与自一致性在数学和代码等有验证器的领域有效,但在没有验证器的领域中无法扩展真实性。论文将在首尔 ICML 2026 会议上报告。

来源:Stanford AI Lab(@StanfordAILab) · x.com