Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Sun Yat-sen University(中山大学) ; National Supercomputing Center in Shenzhen(国家超级计算深圳中心) ; Tsinghua University(清华大学)
AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。