Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
多智能体协作的反事实信用策略优化
机构 * Beihang University(北航) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。