Lilian Weng — Lil’Log·· 2025-05-01AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
为什么我们会思考:测试时计算与思维链综述
Why We Think
AI 导读
Lilian Weng 撰文综述测试时计算与思维链推理的近期进展,解释让模型想更久为何有效。文章从心理学类比、算力资源和隐变量建模三方面给出动机,梳理并行采样与顺序修订两类解码策略,并分析 DeepSeek-R1 等基于 RL 的推理训练方法。文中还讨论思维链忠实性的失败模式,以及连续空间思考、思考 token 和测试时计算缩放规律等方向,并列出待解开放问题。
来源:Lilian Weng — Lil’Log · lilianweng.github.io