RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
RedKnot: 基于头部感知的KV重用和SegPagedAttention的高效长上下文LLM服务
机构 * Xiaohongshu Inc., China(小红书公司,中国) ; Peking University(北京大学) ; Huawei Cloud(华为云)
AI总结 提出RedKnot系统,通过按KV头分解缓存并采用SegPagedAttention,实现位置无关的KV重用、前缀压缩、冷热分离和分布式放置,在不重训练模型的情况下提升资源效率。