Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models
基于扩散的多模态大语言模型的视觉冗余控制并行解码
机构 * Zhejiang University(浙江大学) ; ZJUI-UIUC Institute(ZJUI-UIUC研究院)
AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。
Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD