Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
LLM强化学习后训练的扩展行为:数学推理中的实证研究
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院) ; University of Georgia(佐治亚大学) ; The Chinese University of Hong Kong(香港中文大学) ; Chinese Academy of Sciences(中国科学院) ; Dalian University of Technology(大连理工大学) ; National University of Singapore(新加坡国立大学) ; Wuhan University(武汉大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。
Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference