Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
利用奖励不确定性在强化学习中诱导多样化行为
机构 * New York University(纽约大学) ; Google DeepMind(谷歌DeepMind)
AI总结 针对传统强化学习缺乏多样性的问题,提出将奖励函数替换为奖励分布,通过非线性集合目标自然产生可控的多样化行为,并推导出梯度估计器,实验证明其鲁棒性和理论优势。
Comments Core contributors: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, André Barreto, Mark Rowland