AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
AdaDPO:具有平衡梯度更新的自适应直接偏好优化
机构 * Incept Labs(Incept实验室)
专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对DPO中梯度不对称导致模型偏向避免不良回答而非生成优质回答的问题,提出AdaDPO算法,通过引入基于策略模型生成概率的自适应系数来平衡正负偏好梯度,在AlpacaEval 2上优于DPO并缓解长度偏差。
Comments 5 figures