Decoupled Attention Fusion: Accelerating RAG with Efficient KV Cache Reuse
解耦注意力融合:通过高效的键值缓存重用加速检索增强生成
机构 * Ant Group, China(蚂蚁集团,中国) ; Southeast University, Nanjing, China(东南大学,南京,中国)
专题命中 检索器与排序 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对RAG在长上下文场景中TTFT延迟高及缓存问题,提出解耦注意力融合(DAF)框架,将注意力过程解耦为三个阶段,与Flash-Attention内核兼容,实验显示其在不牺牲准确性的情况下,相比CacheBlend和完全重新计算有显著加速。
Comments Accepted by EuroSys 2026 (poster track)