Equilibrium Selection in Multi-Agent Policy Gradients via Opponent-Aware Basin Entry
通过对手感知盆地入口进行多智能体策略梯度的均衡选择
机构 * Bloomsbury Technology(布洛姆斯伯里技术) ; London School of Economics and Political Science(伦敦政治经济学院) ; University of Bristol(布里斯托大学) ; Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学) ; Odesa Polytechnic National University(敖德萨国立技术大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
AI总结 本文研究了多智能体策略梯度方法在局部收敛到稳定纳什均衡时的均衡选择问题,提出通过对手感知的盆地入口概率机制来提升目标均衡集的进入概率,并通过实验验证了该机制在合作盆地中的有效性。