An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models
小语言模型中SFT-DPO交互与参数化的实证研究
机构 * Department of Computer Science(计算机科学系) ; Stanford University(斯坦福大学)
专题命中 指令微调 :language model(title,abstract);SFT(title,abstract);small language model(title);preference optimization(abstract)
AI总结 本文通过对比SFT、DPO及分阶段训练方法,发现全参数微调在小模型中表现更优,而偏好优化和低秩适应带来的边际收益有限。