Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型
机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ; ETH Zurich(苏黎世联邦理工学院) ; EPFL(苏黎世联邦理工学院)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI
AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。
Comments Project Page: https://kevinqu7.github.io/loc3r-vlm