TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率
机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) ; School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) ; Intellifusion(智融科技)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract);分类 cs.CV
AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。