RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning
RISE-RL:基于评分规则的开放式强化学习选择性探索
机构 * Li Auto Inc.(理想汽车)
AI总结 该研究针对开放式任务中LLM的强化学习探索难题,提出RISE-RL方法,通过奖励过滤与策略支持塑造实现选择性内化,在多领域基准评测中显著优于现有方法。
大厂专区
RISE-RL:基于评分规则的开放式强化学习选择性探索
机构 * Li Auto Inc.(理想汽车)
AI总结 该研究针对开放式任务中LLM的强化学习探索难题,提出RISE-RL方法,通过奖励过滤与策略支持塑造实现选择性内化,在多领域基准评测中显著优于现有方法。