PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发
机构 * Purdue University(普渡大学) ; Beijing University of Chemical Technology(北京化工大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Sungkyunkwan University(成均馆大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。