Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach
无最优演示者的逆强化学习:一种可行奖励集方法
机构 * MIT LIDS(麻省理工学院媒体实验室) ; University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) ; Adobe Research(Adobe研究院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 针对多个非最优演示者数据,提出可行奖励集框架,通过线性约束联合可行集单调收缩,并给出恢复保证与高维环境离线算法。