Optimizing Neurorobot Policy under Limited Demonstration Data through Preference Regret
通过偏好遗憾优化有限示范数据下的神经机器人策略
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Advanced Micro Devices, Inc.(超威半导体公司) ; University of Liverpool(利物浦大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MYOE框架,通过可查询的偏好混合状态空间模型估计每一步的目标,利用偏好遗憾优化机器人控制策略,实验显示其鲁棒性、适应性和泛化能力优于其他RLfD方法。
Comments 10 pages, 4 figures, 4 tables