Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
少看,快思考:多模态大语言模型的联合令牌-计算适配
机构 * Purdue University(普渡大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; NVIDIA(英伟达)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。
Comments Accepted at ECCV 2026