Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract)
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe