Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding
Occ-VLM: 面向室内场景理解的占用接地视觉语言模型
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)
专题命中 视觉问答 :VLM(title,title_cn);vision language model(title);vision-language model(abstract);visual question answering(abstract)
AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。