Unveiling the Visual Counting Bottleneck in Vision-Language Models
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026