AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
AsyncTLS: 高效的生成式大语言模型推理方法与异步两级稀疏注意力
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; Meituan(美团)
AI总结 AsyncTLS通过结合粗粒度块过滤与细粒度token选择,平衡精度与效率,并利用异步卸载引擎提升性能,实现高精度与高吞吐量。