3D-Aware VLMs with Implicit and Explicit Geometries
具有隐式和显式几何的3D感知视觉语言模型
机构 * Nanyang Technological University(南洋理工大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; HuPan Lab(湖畔实验室)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。
Comments Accepted by ECCV 2026, Open Sourced