Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching
基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Soochow University(苏州大学)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。
Comments 16 pages, 5 figures