Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示
机构 * Tsinghua University(清华大学) ; Panasonic AI Lab(松下人工智能实验室) ; Panasonic DX-CPS(松下DX-CPS) ; UC Berkeley(伯克利大学)
AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。
Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D