跳到正文
原文
Hunyuan(@TXhunyuan)· Tencent Hy (@TencentHunyuan)·· 16 天前AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

腾讯混元研究:LLM 强化学习批大小与训练效率新发现

⚡️ As LLM reinforcement learning scales to larger GPU clusters and more training data, training effi...

AI 导读

腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。

来源:Hunyuan(@TXhunyuan) · x.com