Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
解开OPD之谜:大型语言模型中的长度膨胀与稳定策略
机构 * Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿) ; Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特) ; Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩) ; Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了OPD训练中长度膨胀问题,提出StableOPD框架结合参考 divergence 约束和rollout混合蒸馏,有效稳定训练并提升性能。