Consistent Zero-Shot Imitation with Contrastive Goal Inference
基于对比目标推理的零样本模仿一致性方法
机构 * Department of Computer Science, Princeton University, Princeton, NJ, USA(普林斯顿大学计算机科学系)
AI总结 提出对比逆强化学习(CIRL),通过将多任务逆RL转化为目标推理问题,利用对比RL、自动目标提议和变分推断实现零样本模仿,理论证明其能一致恢复演示者意图,实验优于现有方法。