Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study
面向聊天机器人微调的直接偏好优化:一项实证研究
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。
Comments 7 pages, 3 figures, 1 table. All authors contributed equally