PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning
PrefMoE:基于专家混合的鲁棒偏好建模
机构 * Purdue University(普渡大学) ; Beijing University of Chemical Technology(北京化工大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。
Comments IROS 2026