Beyond RLHF: A Unified Theoretical Framework of Alignment
超越RLHF:对齐的统一理论框架
机构 * KRAFTON ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; POSTECH
专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出了一种统一的对齐理论框架,通过将对齐视为基于成对偏好的分布学习,推导出三种新的对齐目标,并证明了它们在非渐近情况下具有O(1/n)的收敛性,为RLHF提供了理论支持。