RLPF: Reinforcement Learning from Performance Feedback for Code Generation
RLPF:基于性能反馈的代码生成强化学习
机构 * HKUST(香港科技大学)
专题命中 代码生成 :code generation(title);code model(abstract);分类 cs.SE、cs.LG
AI总结 该研究提出RLPF方法,将执行结果转化为分阶段奖励,微调Qwen3-32B后提升了代码生成的正确性与效率,模型性能可适度迁移,验证了代码智能体可优化生成程序。