Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
基于原始能力的分层强化学习的直接偏好优化:双层方法
机构 * IIT Kanpur(印度理工学院坎浦尔分校) ; University of Maryland, College Park(马里兰大学学院公园分校) ; U.S. Army Research Laboratory(美国陆军研究实验室) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Oracle(Oracle公司) ; University of Central Florida(中央佛罗里达大学) ; University of Bath(巴斯大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.LG
AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。