Adaptive Margin RLHF via Preference over Preferences
通过偏好之上的偏好进行自适应边际基于人类反馈的强化学习
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究在基于人类反馈的强化学习中奖励模型学习的边际优化问题,提出利用偏好之上的偏好推断自适应边际,介绍具体实例DPO-PoP,提升判别和生成性能,并给出采样策略。