When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
当视觉变为文本:视觉语言模型(VLM)中基于跨模态残差引导的视觉令牌剪枝
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 该研究针对视觉语言模型(VLM)海量视觉令牌导致推理成本高的问题,提出基于跨模态残差(CMR)的无训练压缩方法SIEVE,在LLaVA-NeXT-7B上仅保留11.1%视觉令牌,实现显著加速与缓存缩减且性能损失极小。