Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms
朝着弥合直接对齐算法中的奖励生成差距而努力
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);RLHF(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。
Comments Findings of ACL 2026