Tandem Reinforcement Learning with Verifiable Rewards
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables