Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models
视觉成为文本:在视觉-语言模型中定位OCR路由瓶颈
机构 * Swarms & AI Lab (SAIL), University of Haifa(Swarms与AI实验室(SAIL),海法大学)
专题命中 文档图表理解 :vision-language model(title,abstract);InternVL(abstract,abstract_cn)
AI总结 研究揭示了视觉-语言模型中OCR信息进入语言处理流的瓶颈,通过因果干预分析三种架构,发现不同架构对场景文本和单阶段投影模型的敏感层不同,且PCA方向在不同数据集间可迁移,模块化OCR电路模型中移除OCR可提升计数性能。