Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
回收失败:通过细粒度反策略指导在RLVR中恢复探索
机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) ; Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院) ; University of Leicester, Leicester, United Kingdom(莱斯特大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学)
AI总结 SCOPE通过细粒度反策略指导在RLVR中恢复探索,提高轨迹多样性13.5%,在数学推理和分布外推理任务中取得新突破。