跳到正文
原文
Lilian Weng(@lilianweng)· Lilian Weng (@lilianweng)·· 2025-10-28AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Lilian Weng:On-policy 蒸馏让教师模型充当过程奖励模型

On-policy distillation provides an elegant way to use the teacher model as a process reward model to...

AI 导读

Lilian Weng 指出,on-policy 蒸馏把教师模型当作过程奖励模型,在 rollout 中提供稠密奖励,同时避免 SFT 式的 OOD shock。Thinking Machines 的最新文章称,在数学推理和内部聊天助手训练中,on-policy 蒸馏以更低成本超过其他方法,该训练思路兼具 RL 的纠错相关性与 SFT 的奖励密度。

来源:Lilian Weng(@lilianweng) · x.com