DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
DUET:基于可验证奖励的强化学习中优化令牌预算分配
机构 * Cornell University(康奈尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。