Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法
机构 * University of Florida(佛罗里达大学) ; UC San Diego(加州大学圣迭戈分校) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; Universität Innsbruck(因斯布鲁克大学)
AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。
Comments 14 pages, 2 figures