EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
EvoCut:面向高效大型视觉语言模型的多层演化感知视觉标记压缩
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Xiaohongshu(小红书) ; Fudan University(复旦大学)
AI总结 提出一种无需训练和注意力的视觉标记压缩方法EvoCut,通过分析多层演化偏差估计标记重要性,在LLaVA-1.5-7B上仅保留11.1%的视觉标记即可保持94.4%的平均性能。
Comments Preprint. 12 pages, 6 figures, 7 tables