Geometry-Guided 3D Visual Token Pruning for Video-Language Models
基于几何的3D视觉标记修剪用于视频-语言模型
机构 * Beihang University(北京航空航天大学)
专题命中 其他视频模型 :video-language(title,abstract);分类 cs.CV
AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。
Comments Accepted by CVPR 2026