Berkeley AI Research·· 2025-11-01AI 评分44
Berkeley AI Research:一种不依赖 TD learning 的强化学习算法——分而治之
RL without TD learning
AI 导读
Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。
来源:Berkeley AI Research · bair.berkeley.edu