跳到正文
原文
Berkeley AI Research Blog·· 2025-11-01AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

不依赖 TD 学习的强化学习:用分治范式实现可扩展的 off-policy RL

RL without TD learning

AI 导读

Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。

来源:Berkeley AI Research Blog · bair.berkeley.edu