Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
驯服对手:通过分数目标实现稳定的最小最大深度确定性策略梯度
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院)
AI总结 本文提出MMDDPG框架,通过分数目标平衡任务性能与扰动幅度,以提升连续控制任务中对抗扰动的鲁棒性。