TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Southern University of Science and Technology(南方科技大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Beijing Language and Culture University(北京语言大学) ; Sichuan University(四川大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。