GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理
机构 * Tsinghua University(清华大学) ; Shenzhen University(深圳大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。