Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning
后验优化与截断目标:在生成策略学习中平衡效率与稳定性
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。