Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
统一稀疏注意力与分层记忆以实现可扩展的长上下文LLM服务
机构 * University of Virginia(弗吉尼亚大学) ; Microsoft Research(微软研究院) ; Georgia Institute of Technology(佐治亚理工学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG
AI总结 本文提出SPIN框架,通过统一分区抽象、局部性感知的KV缓存管理器和两级元数据布局,提升稀疏注意力与分层KV存储的协同效率,实现更高的吞吐量和更低的响应时间。
Comments 15 pages