DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training
DiDPO:用于编码智能体训练的差异内差异策略优化
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Stanford University(斯坦福大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Tongji University(同济大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。
Comments 16 pages, 6 figures, work in progress