Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制
机构 * University of Tübingen(图宾根大学) ; Harvard University(哈佛大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)
AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。
Comments 14 pages, 11 figures, 8 tables