Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation
用于从观察中进行安全对抗模仿学习的判别障碍函数
机构 * University of Washington(华盛顿大学)
AI总结 研究针对逆强化学习不安全及控制障碍函数设计难的问题,通过将奖励函数候选限制在CBF空间,实现安全在线控制与经验改进,能从无标签观察中恢复障碍函数,模拟实验显示其安全性能提升,并研究了不同IRL方法的权衡。
Comments 20 pages, 5 figures