Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning
学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; DiDi(滴滴出行) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 指令微调 :SFT(title,title_cn);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)
AI总结 提出一种难度感知的SFT-then-RL框架,通过阶段特定数据集(SFT阶段使用桥接机制,RL阶段使用批判微调)协调数据难度,提升小语言模型推理性能。
Comments 25 pages, 12 figures