When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO
当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。