Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Samsung Electronics(三星电子)
专题命中 空间理解 :spatial understanding(title);分类 cs.CV
AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。
Comments 61 pages, 28 Figures, 15 Tables