MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; AWS AI(AWS人工智能)
AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。
Comments 21 pages, 2 figures, 8 Tables