High-Dimensional Continuous Control Using Generalized Advantage Estimation
利用广义优势估计进行高维连续控制
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出了一种基于广义优势估计的方法,通过减少策略梯度估计的方差来解决高维连续控制中的样本需求问题,并通过信任区域优化提高稳定性和收敛性,从而在复杂的3D运动任务中实现了高效的政策学习。