MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation
MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) ; Beihang University(北航) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院)
专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。
Comments 18 pages, Accepted by CVPR 2026