Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
阅读还是猜测?古希腊版本OCR中视觉语言模型的视觉定位失败
机构 * Inria(法国国家信息与自动化研究所)
专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 通过对比开放权重视觉语言模型与传统OCR基线在低资源古希腊批判版本上的表现,发现VLM即使错误也能生成流畅文本,表明其依赖语言先验,并引入扰动和标记级定位度量分析视觉证据。