ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型
机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; OPPO Research Institute(OPPO研究院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。
Comments 17 pages, 7 figures