Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding
Occ-VLM: 面向室内场景理解的占用接地视觉语言模型
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)
专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV
AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。