From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
从推理链到可验证子问题:课程强化学习使LLM推理能够进行信用分配
机构 * LeapLab, Tsinghua University(清华大学 LeapLab) ; Qiuzhen College, Tsinghua University(清华大学 旗正学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出SCRL框架,通过从参考推理链中生成可验证子问题,解决LLM推理中信用分配问题,提升了在数学推理任务中的性能。