FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
FlashAttention-4:异构硬件扩展下的算法与内核流水线协同设计
机构 * Princeton University(普林斯顿大学) ; Meta ; Colfax Research(Colfax研究公司) ; NVIDIA(NVIDIA公司) ; Georgia Tech(佐治亚理工学院) ; Together AI
AI总结 FlashAttention-4通过异构硬件扩展下的算法与内核流水线协同设计,提升B200 GPU上的注意力计算效率。