REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
REA-RL:面向高效推理的反思意识在线强化学习
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能学院,哈尔滨工业大学深圳学院) ; Zhongguancun Academy, Beijing, China(中关村学院,北京) ; Xiaohongshu Inc.(小红书公司)
AI总结 REA-RL通过引入反思模型和反思奖励,提升在线强化学习中推理效率和性能平衡。
Comments Accepted by ICLR 2026