When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff
当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)
专题命中 指令微调 :SFT(title,title_cn);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。