HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。