arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2603.24326 2026-04-06 cs.CV cs.AI cs.IR 62%

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

通过粗到细的视觉处理提升文档解析效率和性能

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PaddleOCR-VL模型,通过粗到细的视觉处理方法,减少冗余视觉区域,提升文档解析和识别的效率与性能,实验表明其在页面级和元素级识别上均达到最优。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 62%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16098 2026-03-20 cs.CV cs.AI 62%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI 62%

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 62%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 62%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15509 2026-03-17 cs.AI cs.CV 62%

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

Chart-R1: 链式推理监督与强化学习用于高级图表推理器

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Chart-R1,通过链式推理监督和强化学习提升图表推理能力,通过程序化数据合成和两阶段训练策略,在图表领域取得显著性能提升。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV 62%

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16430 2026-02-19 cs.CV cs.AI 62%

Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems

为印度设计生产级OCR:多语言和领域特定系统

Ali Faraz, Raja Kolla, Ashish Kulkarni, Shubham Agarwal

机构 * Krutrim AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种多语言OCR训练策略,通过Chitrapathak系列在印度多语言文档中实现SOTA性能,并展示了Parichay在政府文档中的高效提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14671 2026-02-12 cs.CL cs.AI cs.LG 62%

TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding

TableDART: 表格理解的动态自适应多模态路由

Xiaobo Xing, Wei Yuan, Tong Chen, Quoc Viet Hung Nguyen, Xiangliang Zhang, Hongzhi Yin

机构 * The University of Queensland, Australia(昆士兰大学) Griffith University, Australia(格里菲斯大学) University of Notre Dame, USA(诺丁汉大学)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.AI、cs.LG

AI总结 TableDART通过动态选择文本、图像或融合视角,提升表格理解的准确性和效率,避免昂贵的多模态模型微调。

Comments Accepted to ICLR 2026. 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19790 2026-02-03 cs.LG cs.AI cs.DB 62%

Mixtera: A Data Plane for Foundation Model Training

Mixtera: 一个用于基础模型训练的数据平面

Maximilian Böther, Xiaozhe Yao, Tolga Kerimoglu, Dan Graur, Viktor Gsteiger, Ana Klimovic

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 Mixtera是一种用于基础模型训练的数据平面,允许用户声明性地控制数据样本的比例和顺序,以提升模型训练效果。

Comments accepted at SIGMOD'26; two column layout version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 62%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18735 2026-01-27 cs.AI cs.LG 62%

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Jiawei Yao, Jian Wang, Guanlong Qu, Ziliang Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Snap Inc.(Snap公司) Syracuse University(雪城大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10462 2026-01-21 cs.AI cs.CV 62%

ChartComplete: A Taxonomy-based Inclusive Chart Dataset

ChartComplete: 基于分类的包容性图表数据集

Ahmad Mustapha, Charbel Toumieh, Mariette Awad

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。

Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10055 2026-01-12 cs.CV cs.AI 62%

PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language

PsOCR:用于低资源帕什托语言光学字符识别的大型多模态模型基准测试

Ijazul Haq, Yingjie Zhang, Irfan Ali Khan

机构 * organization= Shien-Ming Wu School of Intelligent Manufacturing, South China University of Technology , city= Guangzhou , postcode= 511442 , country= China organization= Artificial Intelligence Department, Guangdong CAS Angels Biotechnology Co. Ltd. , city= Foshan , country= China organization= Department of Software Engineering, Faculty of Electrical \& Computer Engineering, University of Engineering \& Technology , city= Peshawar , postcode= 25000 , country= Pakistan

专题命中 文档图表理解 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 PsOCR通过合成数据评估大型多模态模型在低资源帕什托语言OCR中的性能,发现Gemini表现最佳,Qwen-7B在开源模型中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05125 2026-01-09 cs.CV cs.AI 62%

VERSE: Visual Embedding Reduction and Space Exploration. Clustering-Guided Insights for Training Data Enhancement in Visually-Rich Document Understanding

VERSE:视觉嵌入减少与空间探索。用于视觉丰富文档理解的训练数据增强的聚类引导洞察

Ignacio de Rodrigo, Alvaro J. Lopez-Lopez, Jaime Boal

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究所、ICAI工程学院、科利马斯天主教大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VERSE通过探索视觉嵌入空间,提升视觉丰富文档理解的训练数据增强效果,使本地模型性能达到或超越SaaS解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG 62%

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09874 2025-12-12 cs.CV cs.AI cs.IR 62%

Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs

对PDF中数学公式提取的文档解析器进行基准测试

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) University of Mannheim, Mannheim, Germany(曼海姆大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18434 2025-11-25 cs.CV cs.AI 62%

DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation

DocPTBench: 用于照片文档解析与翻译的基准测试

Yongkun Du, Pinxuan Chen, Xuye Ying, Zhineng Chen

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Institute of Trustworthy Embodied AI(可信具身人工智能研究所)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 DocPTBench是一个针对真实拍摄文档解析与翻译的基准测试,揭示了从数字生成文档到真实拍摄文档的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08828 2025-11-10 cs.IR cs.AI cs.CL cs.CV 62%

MMDocIR: Benchmarking Multimodal Retrieval for Long Documents

Kuicai Dong, Yujing Chang, Xin Deik Goh, Dexun Li, Ruiming Tang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.AI

Comments Paper accepted to EMNLP-2025(Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21497 2025-10-31 cs.CV cs.AI cs.CL cs.MA 62%

Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers

Wei Pang, Kevin Qinghong Lin, Xiangru Jian, Xi He, Philip Torr

机构 * University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) Vector Institute(向量研究所)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://github.com/Paper2Poster/Paper2Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21774 2025-10-28 cs.CV cs.AI 62%

OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment

Yulong Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20961 2025-09-26 cs.CV cs.AI 62%

Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos

Sarmistha Das, R E Zera Marveen Lyngkhoi, Sriparna Saha, Alka Maurya

机构 * Indian Institute of Technology Patna(印度帕纳杰大学) CRISIL LTD(CRISIL公司)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13282 2025-09-17 cs.CL cs.CV cs.LG 62%

ChartGaze: Enhancing Chart Understanding in LVLMs with Eye-Tracking Guided Attention Refinement

Ali Salamatian, Amirhossein Abaskohi, Wan-Cyuan Fan, Mir Rayat Imtiaz Hossain, Leonid Sigal, Giuseppe Carenini

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19289 2025-08-28 cs.CV cs.AI 62%

Seeing Like a Designer Without One: A Study on Unsupervised Slide Quality Assessment via Designer Cue Augmentation

Tai Inui, Steven Oh, Magdeline Kuan

机构 * Waseda University(早稻田大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21167 2025-08-07 cs.CV cs.AI 62%

ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions

Donglu Yang, Liang Zhang, Zihao Yue, Liangyu Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * independent researcher(独立研究者)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23217 2025-08-01 cs.LG cs.AI 62%

Zero-Shot Document Understanding using Pseudo Table of Contents-Guided Retrieval-Augmented Generation

Hyeon Seong Jeong, Sangwoo Jo, Byeong Hyun Yoon, Yoonseok Heo, Haedong Jeong, Taehoon Kim

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18022 2025-07-25 cs.AI cs.HC cs.LG 62%

Does visualization help AI understand data?

Victoria R. Li, Johnathan Sun, Martin Wattenberg

机构 * Harvard University(哈佛大学) Google Research(谷歌研究)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14298 2025-07-22 cs.CL cs.AI cs.CV 62%

In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding

Wan-Cyuan Fan, Yen-Chun Chen, Mengchen Liu, Alexander Jacobson, Lu Yuan, Leonid Sigal

机构 * UBC(不列颠哥伦比亚大学) Microsoft(微软) Vector Institute for AI(人工智能向量研究所) CIFAR AI Chair(卡尔·弗雷德里克人工智能主席)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2407.14506

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11730 2025-07-17 cs.CV cs.AI 62%

Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis

Maciej Szankin, Vidhyananth Venkatasamy, Lihang Ying

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏