WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation
WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模
机构 * Nanjing University(南京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; FiveAges ; National University of Defense Technology(国防科技大学) ; Tsinghua University(清华大学) ; GigaAI
专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO
AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。