GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models
GUPO:面向后训练大语言模型的梯度不确定性感知策略优化
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG
AI总结 针对GRPO中组梯度冲突导致策略更新效果差的问题,提出GUPO方法,通过贝叶斯框架建模组梯度并结合狄利克雷公式校准梯度贡献,经多基准实验验证其有效性。