3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法
机构 * Pusan National University(釜山国立大学)
专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV
AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip