Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding
预测、重用与修复:加速长上下文LLM解码的动态稀疏注意力
机构 * University of Pittsburgh(匹兹堡大学) ; HPE Labs(HPE实验室)
AI总结 提出PRR运行时系统,利用动态稀疏注意力选择的时间局部性,通过预测、推测和增量修复来减少解码延迟,最高可降低40%的每令牌延迟,同时保持下游任务精度。
Comments 9 pages body plus 3 pages appendix, 13 pages total