Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
通过动态奖励加权学习多目标对齐
机构 * University of Notre Dame(圣母大学) ; Amazon(亚马逊)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出动态奖励加权方法,解决多目标强化学习中固定权重无法捕捉非凸帕累托前沿的问题,通过两种新方法实现有效探索帕累托前沿。