How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用
机构 * Duke University(杜克大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 指令微调 :SFT(title,title_cn);LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。