The Geometry of Representational Failures in Vision Language Models
视觉语言模型中表征失败的几何结构
机构 * Dipartimento di Fisica, Università di Torino(都灵大学物理系) ; Princeton Neuroscience Institute and AI Lab, Princeton University(普林斯顿大学神经科学研究所和AI实验室) ; Intesa Sanpaolo AI Research(Intesa Sanpaolo AI研究中心) ; Dipartimento di Scienze Matematiche, Politecnico di Torino(都灵理工学院数学科学系) ; Network Science Institute, Northeastern University London, UK(伦敦大学东北方大学网络科学研究所)
AI总结 通过分析开源视觉语言模型的概念向量几何重叠,揭示多目标视觉任务中幻觉等错误与认知约束的关联,并提出基于干预的验证方法。