VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
VI-CuRL: 通过置信度引导的方差缩减稳定与验证器无关的强化学习推理
机构 * RIKEN AIP(日本理化学研究所高级研究所) ; The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI、cs.LG
AI总结 提出VI-CuRL框架,利用模型内在置信度构建课程学习,在不依赖外部验证器的情况下通过降低动作和问题方差稳定训练,理论保证渐近无偏性,在数学和通用推理基准上超越依赖/不依赖验证器的基线。