跳到正文
原文
大模型智能·· 3 天前AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

从 TIS 到 score centering,重新理解 LLM RL 中的训推不一致

AI 导读

文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。

来源:大模型智能 · mp.weixin.qq.com