SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models
SAW: 面向大语言模型多目标强化学习的阶段感知动态加权
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对多目标强化学习中奖励学习异步性问题,提出轻量级动态加权机制SAW,利用变异系数实时调整各目标贡献,在GRPO和GDPO框架下提升训练效率和最终性能。
Comments 17 pages, 7 figures, 5 tables