GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding
GQLA: 面向硬件自适应的大语言模型解码的分组查询潜在注意力
机构 * Institute for Artificial Intelligence(人工智能研究院)
专题命中 效率与部署 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出GQLA,一种对MLA的极小修改,通过暴露MQA和GQA两种等价解码路径,使单一权重集在不同硬件(如H100和H20)上达到最优性能,并支持零冗余张量并行,同时通过TransGQLA将预训练GQA检查点转换为GQLA模型,显著压缩KV缓存。