Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力
机构 * Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。