Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
超越动作残差:通过瓶颈潜在强化学习实现现实世界机器人策略引导
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Shanghai Qizhi Institute(上海启智研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
AI总结 本文提出了一种名为Z-Perturbation Reinforcement Learning(ZPRL)的方法,通过紧凑的瓶颈潜在空间来引导预训练策略,从而提高样本效率和最终性能,同时在现实世界任务中显著提升了成功率。