Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
从失败中学习:具有可验证奖励的纠正导向策略优化
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc(小红书公司)
AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。
Comments Work on progress