DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理
机构 * University of Zurich(苏黎世大学) ; University of Pennsylvania(宾夕法尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; HKUST (GZ)(香港科技大学(广州))
AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。
Comments 13 pages, 6 figures