Stanford AI Lab(@StanfordAILab)· Stanford AI Lab (@StanfordAILab)·· 2026-06-24AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Spiral:用 RL 让 LLM 学会并行采样与聚合推理
At test time, we wrap LLMs in scaffolds that scale compute every which way -- longer chains, paralle...
AI 导读
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。
来源:Stanford AI Lab(@StanfordAILab) · x.com