Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
反馈操纵正则化:实现用于模仿学习的离线智能体对齐
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI、cs.LG
AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。