Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
面向大视觉-语言模型的注意力感知推理优化
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Research(思科研究)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。