跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分44

Berkeley AI Research:一种不依赖 TD learning 的强化学习算法——分而治之

RL without TD learning

AI 导读

Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。

来源:Berkeley AI Research · bair.berkeley.edu