GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization
GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; Renmin University of China(中国人民大学) ; Peking University(北京大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.LG
AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。
Comments 24 pages, 9 figures