GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
GoViG:通过多模态推理实现目标条件视觉导航指令生成
机构 * University of Washington(华盛顿大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。
Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG