DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Amazon(亚马逊) ; Northeastern University(东北大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(title);分类 cs.CV
AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。
Comments Accepted at CVPR Findings 2026