跳到正文
原文
Modal Blog·· 2026-06-01AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Modal 发布开源库 Modal Dojo,将 RL 后训练基础设施抽象为百行代码

Reinforcement learning is an infrastructure problem

AI 导读

Modal 发布实验性开源库 Modal Dojo,让用户在 100 行以内代码中定义训练任务,只需配置奖励函数、模型和环境。Modal 表示 RL 后训练的瓶颈在基础设施,训练器与 rollout 引擎间的权重同步是主要开销,同集群内 RDMA 传输可将训练速度提升 100 倍,其 Sandbox 可每秒启动数千个、并发维持上百万个。

来源:Modal Blog · modal.com