Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning
以演化 rubric 作为奖励的强化学习用于音频推理
机构 * University of Maryland(马里兰大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出 AudioRubrics 强化学习框架,以自演化的音频基 rubric 奖励监督音频推理,在三个基准上大幅优于基线,收敛至稳定推理长度,提升音频感知效果。