Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities
长周期Q学习:通过n步不等式实现准确的价值学习
机构 * Stanford University(斯坦福大学)
AI总结 本文提出长周期Q学习(LQL),通过引入n步不等式来抑制误差累积,提升长周期学习稳定性,实验表明其在多种基准上优于传统TD方法。
作者
Robotics / Machine Learning
长周期Q学习:通过n步不等式实现准确的价值学习
机构 * Stanford University(斯坦福大学)
AI总结 本文提出长周期Q学习(LQL),通过引入n步不等式来抑制误差累积,提升长周期学习稳定性,实验表明其在多种基准上优于传统TD方法。