Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
Dr. Post-Training:一种数据正则化视角下的LLM后训练
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan(密歇根大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,title_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn)
AI总结 本文提出Dr. Post-Training框架,通过将通用训练数据作为数据诱导正则化器,防止模型过拟合稀缺目标数据,从而提升LLM后训练效果。