REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
REA-RL:面向高效推理的反思意识在线强化学习
Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Jun Rao, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能学院,哈尔滨工业大学深圳学院)
;
Zhongguancun Academy, Beijing, China(中关村学院,北京)
;
Xiaohongshu Inc.(小红书公司)