跳到正文
Berkeley AI Research·· 2025-11-01AI 评分48

不依赖 TD learning 的强化学习

RL without TD learning

AI 导读

Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。

来源:Berkeley AI Research · bair.berkeley.edu