2508.09547
2026-04-30
cs.CV
cs.AI
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
GoViG:通过多模态推理实现目标条件视觉导航指令生成
Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng
机构
*
University of Washington(华盛顿大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Microsoft Research(微软研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
AI总结
本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。