ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training
ShapE-GRPO:基于多候选LLM训练的Shapley增强奖励分配
机构 * MIT(麻省理工学院) ; University of Sydney(悉尼大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
AI总结 针对多候选LLM训练中奖励分配噪声问题,提出ShapE-GRPO方法,通过Shapley值理论分解集级奖励,提升训练效率与收敛速度。