GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Huawei(华为)
专题命中 视觉定位与Grounding :MLLM(title,title_cn);multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。
Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/