arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2603.13134 2026-03-16 cs.AI 57%

When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO

当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO

Yu Li, Tian Lan, Zhengling Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏