Probing RLVR training instability through the lens of objective-level hacking
通过目标层面黑客的视角探查RLVR训练不稳定性
机构 * School of Physics, Peking University(北京大学物理学院) ; Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团) ; Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) ; National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。
Comments Accepted by ICML 2026