STAIF: A Stage-wise Optimization for Complex Instruction Following
STAIF:一种用于复杂指令跟随的逐阶段优化方法
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research Group(科大讯飞研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。
Comments 16 pages, 6 figures