Privacy Preserving Reinforcement Learning with One-Sided Feedback
具有单侧反馈的隐私保护强化学习
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Cornell SC Johnson College of Business(康奈尔大学SC Johnson商学院)
AI总结 本文研究了在多维连续状态和动作空间中,代理仅接收状态部分观测并仅在每个时间步获得状态-动作空间子集奖励信息的强化学习问题,提出了一种新的隐私保护强化学习算法POOL,并通过理论分析证明其样本复杂度与非隐私强化学习的下界一致,展示了在保持高学习效率的同时实现强隐私保障的可行性。
Comments Accepted at IJCAI-ECAI 2026