Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings
稀疏奖励任务中具有多样化奖励塑造的零 shot 协调
机构 * Department of Computer Science(计算机科学系) ; University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文提出了一种基于随机奖励塑造的多智能体强化学习方法,通过4种算法选择策略训练多个方法,提升在Overcooked环境中的稀疏奖励表现,改进率达62.2%-119.2%。