arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-25 至 2026-06-25 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2606.26041 2026-06-25 cs.CV cs.CL 新提交 87%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25838 2026-06-25 cs.CV cs.AI 新提交 79%

Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines

边缘先于嵌入:面向视觉语言管线的置信感知模糊门控

Duy Tran Thanh

机构 * OneMount Group(OneMount集团)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MagikaDocumentFromPixel轻量级图像质量门控,通过边缘先验模块和置信感知路由,在7ms内分类图像清晰度,F1达0.9803。

Comments 7 pages, 2 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24895 2026-06-25 cs.DL 新提交 50%

Hybrid Metadata Extraction from League of Nations Index Cards: From Feasibility Study to Archival System Integration

国联索引卡片的混合元数据提取:从可行性研究到档案系统集成

Florian Cafiero, Grégoire Mallard

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏