STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU
STEEL:用于在AMD的XDNA NPU上进行节能长序列推理的稀疏感知融合注意力
机构 * AMD Research and Advanced Development (RAD)(AMD研究与先进开发) ; Integrated Systems Laboratory (IIS)(集成系统实验室) ; ETH Zürich(苏黎世联邦理工学院) ; Department of Electrical, Electronic and Information Engineering (DEI)(电气电子信息工程系) ; University of Bologna(博洛尼亚大学)
AI总结 研究针对笔记本级SoC上节能推理,提出STEEL这一针对类似XDNA的NPU的FlashAttention开源实现,通过引入预填充注意力数据流公式化及稀疏感知流水线布局,降低能耗与延迟,相比CPU和GPU有显著性能提升。
Comments Accepted at IEEE COINS 2026