arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-26 至 2026-03-26 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2603.24373 2026-03-26 cs.CV 79%

PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡

Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu

机构 * PaddlePaddle Team(PaddlePaddle团队) Baidu Inc(百度公司)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 73%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 50%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏