arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Hewlett Packard Enterprise(慧与)

2026-06-30 至 2026-06-30 共收录 1
2606.30389 2026-06-30 cs.LG

Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding

预测、重用与修复:加速长上下文LLM解码的动态稀疏注意力

Tianyu Wang, Gourav Rattihalli, Aditya Dhakal, Junbo Li, Zhiwei Ren, Dejan Milojicic, Longfei Shangguan

机构 * University of Pittsburgh(匹兹堡大学) HPE Labs(HPE实验室)

AI总结 提出PRR运行时系统,利用动态稀疏注意力选择的时间局部性,通过预测、推测和增量修复来减少解码延迟,最高可降低40%的每令牌延迟,同时保持下游任务精度。

Comments 9 pages body plus 3 pages appendix, 13 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏