Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
可证明地同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余
专题命中 偏好对齐 :RLHF(title,abstract);DPO(title,abstract);alignment(title);分类 cs.AI、cs.LG
AI总结 本文提出RLHF-COV和DPO-COV算法,同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余问题,并通过理论证明和实验验证其有效性。
Comments Edited a few incorrect numbers in Tables 2 and 3