Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards
具有可验证奖励的强化学习的非空泛化界限
机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; MIT(麻省理工学院) ; Bridgewater AIA Labs(布里奇沃特人工智能实验室)
AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。
Comments 22 pages, 7 figures