VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理
机构 * University of California, Riverside(加州大学河滨分校) ; MBZUAI(穆桑人工智能研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。
Comments Accepted at the Conference on Language Modeling 2026