InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
InnerQ: 一种面向硬件的无需调优的KV缓存量化方法用于大语言模型
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
AI总结 本文提出InnerQ,一种面向硬件的KV缓存量化方法,旨在减少解码延迟而不影响评估性能,通过分组量化策略提高数据重用率,从而在Llama和Mistral模型上提升了少样本评估得分。
Comments 18 pages, 5 figures, 7 tables