Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题
机构 * Meta AI ; Columbia University(哥伦比亚大学)
AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。
Comments 24 Pages