Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning
揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因
机构 * ShanghaiTech University(上海科技大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhejiang University(浙江大学)
AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。
Comments 19 pages, 4 figures, 8 Tables