LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention
LiteTopK:利用维度诅咒设计长上下文稀疏注意力中的融合索引器 - TopK 内核
机构 * Nanyang Technological University(南洋理工大学) ; ETH Zurich(苏黎世联邦理工学院) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 研究针对现有 GPU 索引器 - TopK 内核效率低的问题,利用维度诅咒设计 LITETOPK 内核,通过采样估计得分范围划分候选结果桶,降低内存开销,在实际部署中加速 GLM 5.2 预填充阶段,提升了效率。