Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning
以合适的速度学习:自适应数据调度改进大语言模型强化学习
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(莱斯大学) ; University of Haifa(海法大学) ; Workato ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。