Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
通过鲁棒直接偏好优化与稀疏MoE对齐多模态序列推荐
机构 * Sun Yat-sen University(中山大学) ; Snap Inc(Snap公司)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文研究了在隐式反馈下直接偏好优化的行为,通过系统实验比较了常见负样本选择策略及其与DPO训练的交互,发现用动态top-K候选池进行随机采样可提升排名性能,原因在于减少错误抑制梯度和保留信息硬信号。