Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。