Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
视觉还是认知?多模态大语言模型的视觉上下文敏感性
机构 * University of Copenhagen(哥本哈根大学) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Clemson University(克莱姆森大学)
AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。