Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
偏差拟合以缓解RLHF中奖励模型的长度偏差
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :RLHF(title,title_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。
Comments 16 pages, 12 figures. Accepted to ACL 2026