ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐
机构 * Peking University(北京大学) ; Xiaohongshu Inc.(小红书公司) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。