HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers
HSMLA:用于高效视觉Transformer的分层Softmax多尺度线性注意力
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学) ; The University of Melbourne(墨尔本大学)
AI总结 针对视觉Transformer高分辨率密集预测的计算开销问题,提出HSMLA,结合多类注意力机制与深度卷积,在多项任务上实现精度与效率的优异平衡。