Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently
RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯
机构 * Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。