Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
面向变化的视觉令牌丢弃以加速更大的视觉-语言模型
机构 * Sichuan University(四川大学) ; EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Zhejiang University(浙江大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。
Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}