AlphaZero in Sparsely Rewarded Games: Limits and Auxiliary Supervision
稀疏奖励游戏中的AlphaZero:局限性与辅助监督
机构 * California Institute of Technology(加州理工学院)
AI总结 研究在稀疏奖励游戏中普通AlphaZero的局限性,对比多帧变体及AZAL,发现普通AlphaZero虽表现出色但无法保持最优轨迹,AZAL能显著提高预言一致性,在啃咬和四子棋游戏中均有改进。
高校专区
稀疏奖励游戏中的AlphaZero:局限性与辅助监督
机构 * California Institute of Technology(加州理工学院)
AI总结 研究在稀疏奖励游戏中普通AlphaZero的局限性,对比多帧变体及AZAL,发现普通AlphaZero虽表现出色但无法保持最优轨迹,AZAL能显著提高预言一致性,在啃咬和四子棋游戏中均有改进。