LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining
LoKiFormer:面向高效大语言模型预训练的 locality-aware 注意力与解耦知识记忆
机构 * AIGCode ; South China University of Technology(华南理工大学) ; Pazhou Laboratory(琶洲实验室)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)
AI总结 针对LLM预训练效率问题,提出含局部融合注意力与知识记忆模块的LoKiFormer,使预训练收敛速度提升1.33倍,性能优于现有架构。
Comments Accepted by ICML 2026