Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training
Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。