SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。
Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026