跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分32

不依赖 TD 学习的强化学习:用分治法扩展 off-policy RL

RL without TD learning

AI 导读

一篇新文章提出用"分治法"替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治式价值学习扩展到 goal-conditioned RL 这类复杂任务,并给出基于三角不等式的传递性 Bellman 更新规则。难点在于如何选取最优子目标 w。

来源:Berkeley AI Research · bair.berkeley.edu