FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation
FutureNav: 面向视觉与语言导航的统一世界-动作建模
机构 * Tsinghua University(清华大学) ; Pengcheng Laboratory(鹏城实验室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Xiaomi EV(小米电动车) ; National University of Singapore(新加坡国立大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。