Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
超越二元:将部分成功转化为代码生成中强化学习的密集可验证奖励
机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司Xingchen AGI实验室) ; National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,西安交通大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI、cs.LG
AI总结 提出VeRPO框架,利用代码测试的部分成功作为可验证密集奖励,通过动态密度校准局部奖励修正基数偏差,并与全局执行结果结合,提升代码生成强化学习的性能。