MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
MASS-DPO:多负样本主动采样用于直接策略优化
机构 * UC San Diego(UC圣地亚哥大学) ; Adobe Research(Adobe研究院)
AI总结 MASS-DPO通过多负样本主动采样方法,在Plackett-Luce模型下扩展直接偏好优化,通过选择信息丰富的负样本子集提升策略更新效率,减少冗余梯度,提升模型性能。