Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
基于结果锚定的优势重塑用于数学推理中的细粒度信用分配
机构 * Fudan University(复旦大学) ; XingYun lab, HUJING Digital Media & Entertainment Group(星云实验室,HUJING数字媒体与娱乐集团) ; University of Science and Technology Beijing(北京科技大学) ; Chinese Academy of Sciences(中国科学院) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出结果锚定优势重塑(OAR),通过两种策略(OAR-P和OAR-G)实现细粒度信用分配,显著提升GRPO在数学推理中的性能。