Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning
结果奖励并不能保证可验证或因果重要的推理
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL
AI总结 本文通过实验发现,尽管RLVR提升了任务准确率,但并未可靠提升推理的因果重要性和充分性,通过预训练可改善此问题,辅助奖励能进一步提升推理质量。