arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Xiaohongshu(小红书)

2026-03-02 至 2026-03-02 共收录 1
2505.19862 2026-03-02 cs.CL cs.LG

REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning

REA-RL:面向高效推理的反思意识在线强化学习

Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Jun Rao, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能学院,哈尔滨工业大学深圳学院) Zhongguancun Academy, Beijing, China(中关村学院,北京) Xiaohongshu Inc.(小红书公司)

AI总结 REA-RL通过引入反思模型和反思奖励,提升在线强化学习中推理效率和性能平衡。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏