Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
通过随机选择的少样本引导提升可验证奖励的强化学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出FEST算法,通过随机选择的少样本引导提升可验证奖励的强化学习,仅需128个演示即可获得优于基线的结果,关键在于监督信号、在线信号和衰减权重。
Comments 25 pages, 11 figures