GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) ; Juhaokan Technology Co.,Ltd(极皓科技有限公司) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。
Comments 10 pages, 11 figures