跳到正文
原文
Thomas Wolf(@Thom_Wolf)· Thomas Wolf (@Thom_Wolf)·· 23 天前AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

小米 MiMo-V2.6 大规模 RL 训练进展公开,Fuli Luo 称将逐项开源细节

Impressive level of openness on such a large run

AI 导读

小米 MiMo-V2.6 正处于 RL 训练中,团队近半年专注研究 RL 能扩展到多大程度。这一轮在三个方向做了扩展:每步约 2B tokens 的算力(1568 prompts × 16 rollouts,全异步)、多任务智能体 RL 环境与 harness(单次运行中混合多种 harness),以及评分算力(组内智能体信用分配,结合测试用例与 rubric 奖励)。

来源:Thomas Wolf(@Thom_Wolf) · x.com