Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models
多目标偏好优化:提升生成模型的人类对齐
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract)
AI总结 针对RLHF和偏好优化方法假设单一目标的问题,提出多目标偏好优化框架MOPO,通过约束KL散度最大化主要目标并保障次要目标下限,在合成基准和人类偏好数据上实现帕累托最优策略。
Comments arXiv admin note: text overlap with arXiv:2406.18853 by other authors