Berkeley AI Research·· 2025-11-01AI 评分48
不依赖 TD learning 的强化学习
RL without TD learning
AI 导读
Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。
来源:Berkeley AI Research · bair.berkeley.edu