HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval
HERALD: 通过CPU-GPU协同KV缓存检索实现高吞吐量块扩散LLM服务
机构 * Seoul National University(首尔国立大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对块扩散LLM中KV缓存随上下文增长导致吞吐量下降的问题,提出HERALD系统,利用块内去噪步骤间KV条目一致性,通过稀疏检索和计算重叠实现高精度低开销的KV卸载,在5-10%缓存预算下达到近无损精度,延迟降低1.59倍,吞吐量提升2.47倍。