Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient
基于随机解耦策略梯度的高效在策略视觉强化学习
机构 * Yale University(耶鲁大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Sydney(悉尼大学)
专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出随机解耦策略梯度(SDPG)方法,通过轨迹滚动的随机扰动估计策略梯度,在单GPU上数小时内端到端训练多样化的视觉运动控制策略,显著降低计算和内存开销,并在视觉MuJoCo基准测试中优于基线方法。