Process Reward Informed Tree Rollout for Effective Multi-Turn RL
用于有效多轮强化学习的过程奖励引导树展开
机构 * UC San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; MIT Alumni(麻省理工学院校友)
AI总结 研究多轮强化学习中有效探索问题,提出过程评分器引导的自适应树展开框架PATR,利用过程反馈评分轨迹、选择性分支等,在FrozenLake和SWE - Bench实验中提升性能,是可扩展多轮强化学习的有效策略。
Comments Preprint