KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression
Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。
Comments 9 pages, 6 figures