arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2512.01248 2026-03-25 cs.CV 79%

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13238 2026-03-09 cs.CV 79%

DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model

DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力

Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14524 2026-02-17 cs.CV 79%

Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model

历史OCR中的错误模式:TrOCR与视觉语言模型的比较分析

Ari Vesalainen, Eetu Mäkelä, Laura Ruotsalainen, Mikko Tolonen

机构 * University of Helsinki, Department of Computer Science, Finland(赫尔辛基大学计算机科学系) University of Helsinki, Department of Digital Humanities, Finland(赫尔辛基大学数字人文系)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文比较了TrOCR与视觉语言模型在历史文本OCR中的表现,发现两者在错误模式和学术可靠性上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21639 2026-02-05 cs.CV 79%

OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models

OCRVerse: 向端到端视觉语言模型中的整体OCR迈进

Yufeng Zhong, Lei Chen, Xuanle Zhao, Wenkang Han, Liming Zheng, Jing Huang, Deyang Jiang, Yilin Cao, Lin Ma, Zhixiong Zeng

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 OCRVerse是一种端到端的全面OCR方法,通过多领域训练实现文本和视觉导向OCR的统一,提升跨领域数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL 79%

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02498 2025-12-18 cs.CV 79%

dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model

dots.ocr: 一种单一视觉-语言模型中的多语言文档布局解析

Yumeng Li, Guang Yang, Hao Liu, Bowen Wang, Colin Zhang

机构 * hi lab(hi实验室) Xiaohongshu Inc(小红书公司)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 dots_ocr是一种单一视觉-语言模型,通过联合学习多语言文档布局解析的三个核心任务,实现了统一框架下的高效性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22448 2025-12-01 cs.AI cs.IR 79%

Structured Extraction from Business Process Diagrams Using Vision-Language Models

使用视觉-语言模型从业务流程图中提取结构

Pritam Deka, Barry Devereux

机构 * Queen's University Belfast(女王大学贝尔法斯特)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出使用视觉-语言模型和OCR技术从BPMN图像中提取结构化数据,无需源文件或文本注释。

Comments To appear in the Proceedings of the 2026 ACM Symposium on Applied Computing (SAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19806 2025-11-26 cs.CV 79%

Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes

在行之间阅读:通过潜在表示探测避免VLM生成的OCR错误

Jihan Yao, Achin Kulshrestha, Nathalie Rauschmayr, Reed Roberts, Banghua Zhu, Yulia Tsvetkov, Federico Tombari

机构 * University of Washington(华盛顿大学) Google(谷歌)

专题命中 文档图表理解 :VLM(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出通过潜在表示探测提升VLM在OCR任务中的回避准确性,通过内部状态检测置信度信号,提高系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11313 2025-11-24 cs.CV 79%

DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding

DocSLM:一种用于长多模态文档理解的小型视觉-语言模型

Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta

机构 * Microsoft(微软公司) LMU Munich(慕尼黑大学) MCML FAIR Meta(Meta FAIR) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 DocSLM通过高效的小型视觉-语言模型,在受限内存下实现长多模态文档理解,使用更少的资源达到与先进方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15059 2025-11-20 cs.CV cs.CL 79%

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(日本国立信息机构) NII LLMC Tokyo, Japan(日本国立信息机构LLMC东京)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15865 2025-10-01 cs.CV 79%

How Do Large Vision-Language Models See Text in Image? Unveiling the Distinctive Role of OCR Heads

Ingeol Baek, Hwan Chang, Sunghyun Ryu, Hwanhee Lee

专题命中 文档图表理解 :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22186 2025-09-30 cs.CV cs.CL 79%

MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing

Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Yuanhong Zheng, Dongsheng Ma, Zirui Tang, Boyu Niu, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Jingzhou Chen, Fangdong Wang, Xiaomeng Zhao, Liqun Wei, Wei Li, Shasha Wang, Ruiliang Xu, Yuanyuan Cao, Lu Chen, Qianqian Wu, Huaiyu Gu, Lindong Lu, Keming Wang, Dechen Lin, Guanlin Shen, Xuanhe Zhou, Linfeng Zhang, Yuhang Zang, Xiaoyi Dong, Jiaqi Wang, Bo Zhang, Lei Bai, Pei Chu, Weijia Li, Jiang Wu, Lijun Wu, Zhenxiang Li, Guangyu Wang, Zhongying Tu, Chao Xu, Kai Chen, Yu Qiao, Bowen Zhou, Dahua Lin, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

Comments Technical Report; GitHub Repo: https://github.com/opendatalab/MinerU Hugging Face Model: https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B Hugging Face Demo: https://huggingface.co/spaces/opendatalab/MinerU

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20168 2025-09-23 cs.CV 79%

Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models

Zhentao He, Can Zhang, Ziheng Wu, Zhenghao Chen, Yufei Zhan, Yifan Li, Zhao Zhang, Xian Wang, Minghui Qiu

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) RUC(中国人民大学)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07473 2025-09-10 cs.AI 79%

SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflection

Qin Chen, Yuanyi Ren, Xiaojun Ma, Mugeng Liu, Han Shi, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02906 2025-08-21 cs.CL cs.AI 79%

Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement

Zhihan Zhang, Yixin Cao, Lizi Liao

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06492 2025-08-11 cs.CV cs.CL 79%

Effective Training Data Synthesis for Improving MLLM Chart Understanding

Yuwei Yang, Zeyu Zhang, Yunzhong Hou, Zhuowan Li, Gaowen Liu, Ali Payani, Yuan-Sen Ting, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Ohio State University(俄亥俄州立大学) Cisco(思科公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (poster). 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14823 2025-07-22 cs.CV 79%

FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models

Dong Shu, Haoyang Yuan, Yuchen Wang, Yanguang Liu, Huopu Zhang, Haiyan Zhao, Mengnan Du

机构 * Northwestern University(西北大学) NewsBreak New Jersey Institute of Technology(新泽西理工学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

Comments 20 Pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06761 2025-07-10 cs.CV 79%

Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu

Yan Hon Michael Chung, Donghyeok Choi

机构 * Division of Humanities(人文学院) The Hong Kong University of Science and Technology(香港科学与技术大学) History, Religious and Philosophy Academy(历史、宗教与哲学学院) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17202 2025-05-26 cs.HC cs.CL cs.CV 79%

CHART-6: Human-Centered Evaluation of Data Visualization Understanding in Vision-Language Models

Arnav Verma, Kushin Mukherjee, Christopher Potts, Elisa Kreiss, Judith E. Fan

机构 * Department of Psychology at Stanford University(斯坦福大学心理学系) Department of Linguistics at Stanford University(斯坦福大学语言学系) Department of Communication at University of California, Los Angeles(加州大学洛杉矶分校传播系)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04214 2025-05-08 cs.CV 79%

CM1 -- A Dataset for Evaluating Few-Shot Information Extraction with Large Vision Language Models

Fabian Wolf, Oliver Tüselmann, Arthur Matei, Lukas Hennies, Christoph Rass, Gernot A. Fink

机构 * TU Dortmund University(图宾根大学) LAMARR, Institute for Machine Learning and Artificial Intelligence(LAMARR机器学习与人工智能研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20220 2025-04-30 cs.CL cs.CV 79%

A Multimodal Pipeline for Clinical Data Extraction: Applying Vision-Language Models to Scans of Transfusion Reaction Reports

Henning Schäfer, Cynthia S. Schmidt, Johannes Wutzkowsky, Kamil Lorek, Lea Reinartz, Johannes Rückert, Christian Temme, Britta Böckmann, Peter A. Horn, Christoph M. Friedrich

机构 * Institute for Transfusion Medicine, University Hospital Essen, Hufelandstraße 55, Essen, Germany(1 输血医学研究所,埃森大学医院,Hufelandstraße 55,德国) Department of Computer Science, University of Applied Sciences and Arts Dortmund (FHDO), Emil-Figge Str. 42, Dortmund, Germany(2 计算机科学系,多特蒙德应用科学大学(FHDO),Emil-Figge Str. 42,德国) Institute for Medical Informatics, Biometry and Epidemiology (IMIBE), University Hospital Essen, Hufelandstraße 55, Essen, Germany(3 医学信息学、生物统计学和流行病学研究所(IMIBE),埃森大学医院,Hufelandstraße 55,德国) Institute for AI in Medicine (IKIM), University Hospital Essen, Girardetstraße 2, Essen, Germany(4 医学人工智能研究所(IKIM),埃森大学医院,Girardetstraße 2,德国) Institute of Interventional and Diagnostic Radiology and Neuroradiology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(5 干预性和诊断放射学及神经放射学研究所,埃森大学医院,Hufelandstraße 55,德国) Department of Dermatology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(6 皮肤科系,埃森大学医院,Hufelandstraße 55,德国)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01449 2025-03-03 cs.IR cs.CL cs.CV 79%

ColPali: Efficient Document Retrieval with Vision Language Models

Manuel Faysse, Hugues Sibille, Tony Wu, Bilel Omrani, Gautier Viaud, Céline Hudelot, Pierre Colombo

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12961 2025-02-28 cs.CV 79%

Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution

Zuyan Liu, Yuhao Dong, Ziwei Liu, Winston Hu, Jiwen Lu, Yongming Rao

专题命中 文档图表理解 :MLLM(title,abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06445 2025-02-11 cs.CV 79%

Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments

Sankalp Nagaonkar, Augustya Sharma, Ashish Choithani, Ashutosh Trivedi

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

Comments Code and dataset: https://github.com/video-db/ocr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05122 2025-01-10 cs.CL cs.CV 79%

Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model

Gregor Geigle, Florian Schneider, Carolin Holtermann, Chris Biemann, Radu Timofte, Anne Lauscher, Goran Glavaš

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16234 2024-09-27 cs.CV 79%

Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities

Shiyu Xia, Junyu Xiong, Haoyu Dong, Jianbo Zhao, Yuzhang Tian, Mengyu Zhou, Yeye He, Shi Han, Dongmei Zhang

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV

Journal ref Proceedings of the 3rd Workshop on Advances in Language and Vision Research (ALVR), Pages 116-128, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21013 2024-06-05 cs.CV 79%

StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond

Pengyuan Lyu, Yulin Li, Hao Zhou, Weihong Ma, Xingyu Wan, Qunyi Xie, Liang Wu, Chengquan Zhang, Kun Yao, Errui Ding, Jingdong Wang

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14801 2024-04-24 cs.CV 79%

DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models

Jieru Lin, Danqing Huang, Tiejun Zhao, Dechen Zhan, Chin-Yew Lin

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-14 cs.CV cs.AI 新提交 79%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09100 2026-08-11 cs.LG cs.CV 新提交 79%

Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition

真实数据缩小光学化学结构识别中的合成到真实的差距

Yani Guan, Dengpan Dong, Zi Wei, Shuang Luo, Dan Hannah, Yumin Zhang, Kang Xu

机构 * SES AI Corporation(SES AI公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 该研究针对光学化学结构识别中合成与真实数据的性能差距,通过微调不同视觉语言模型,发现标注真实训练数据可大幅提升性能,且模型与适配策略的选择需结合目标任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏