arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Li Auto(理想汽车)

2026-08-11 至 2026-08-11 共收录 1
2608.09123 2026-08-11 cs.AI 新提交

RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

RISE-RL:基于评分规则的开放式强化学习选择性探索

Jinkun Hou, Zhuo Liu, Huimin Ren, Hongsheng Xin, Pan Zhou, Kun Zhan

机构 * Li Auto Inc.(理想汽车)

AI总结 该研究针对开放式任务中LLM的强化学习探索难题,提出RISE-RL方法,通过奖励过滤与策略支持塑造实现选择性内化,在多领域基准评测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏