Off-Policy Value-Based Reinforcement Learning for Large Language Models
为大语言模型设计的非策略价值基于强化学习
机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(大数据研究院(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。