arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2507.04036 2025-07-08 cs.CV 57%

PresentAgent: Multimodal Agent for Presentation Video Generation

Jingwei Shi, Zeyu Zhang, Biao Wu, Yanjie Liang, Meng Fang, Ling Chen, Yang Zhao

机构 * AI Geeks, Australia Australian Artificial Intelligence Institute, Australia(澳大利亚人工智能研究所) University of Liverpool, United Kingdom(利物浦大学) La Trobe University, Australia(拉特罗布大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21601 2025-07-03 cs.IR cs.CV 57%

Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization

Duong Bach

机构 * FPT University Sun Asterisk(FPT大学Sun Asterisk)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21934 2025-06-30 cs.IR cs.CV 57%

CAL-RAG: Retrieval-Augmented Multi-Agent Generation for Content-Aware Layout Design

Najmeh Forouzandehmehr, Reza Yousefi Maragheh, Sriram Kollipara, Kai Zhao, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21600 2025-06-30 cs.CL cs.AI cs.IR 57%

Structured Attention Matters to Multimodal LLMs in Document Understanding

Chang Liu, Hongkai Chen, Yujun Cai, Hang Wu, Qingwen Ye, Ming-Hsuan Yang, Yiwei Wang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20326 2025-06-26 cs.CV cs.CL cs.DB 57%

From Codicology to Code: A Comparative Study of Transformer and YOLO-based Detectors for Layout Analysis in Historical Documents

Sergio Torres Aguilar

机构 * University of Luxembourg(卢森堡大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15195 2025-06-24 cs.CV 57%

Benchmarking Large Language Models for Handwritten Text Recognition

Giorgia Crosilla, Lukas Klic, Giovanni Colavizza

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05061 2025-06-06 cs.CV 57%

A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions

Anh Le, Thanh Lam, Dung Nguyen

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24600 2025-06-02 cs.CV 57%

SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition

Omer Nacar, Yasser Al-Habashi, Serry Sibaee, Adel Ammar, Wadii Boulila

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11015 2025-05-28 cs.CV 57%

WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?

An-Lan Wang, Jingqun Tang, Liao Lei, Hao Feng, Qi Liu, Xiang Fei, Jinghui Lu, Han Wang, Weiwei Liu, Hao Liu, Yuliang Liu, Xiang Bai, Can Huang

机构 * ByteDance, China(字节跳动,中国) Huazhong University of Science and Technology, China(华中科技大学,中国)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18142 2025-05-27 cs.CV cs.DB 57%

TokBench: Evaluating Your Visual Tokenizer before Visual Generation

Junfeng Wu, Dongliang Luo, Weizhi Zhao, Zhihao Xie, Yuanhao Wang, Junyi Li, Xudong Xie, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

Comments Benchmark, homepagee: https://wjf5203.github.io/TokBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17235 2025-05-26 cs.CV cs.CL 57%

CHAOS: Chart Analysis with Outlier Samples

Omar Moured, Yufan Chen, Ruiping Liu, Simon Reiß, Philip Torr, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Data and code are publicly available at: http://huggingface.co/datasets/omoured/CHAOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11651 2025-05-22 cs.IR cs.CV 57%

MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark

Radek Osmulski, Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Benedikt Schifferer, Even Oldridge

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴库尔Inria) Rajiv Gandhi University Doimukh(拉朱·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(Palmer研究实验室) The Kumquat Consortium(Kumquat联盟)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14846 2025-05-22 cs.CV cs.CL 57%

Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation

Yue Yang, Ajay Patel, Matt Deitke, Tanmay Gupta, Luca Weihs, Andrew Head, Mark Yatskar, Chris Callison-Burch, Ranjay Krishna, Aniruddha Kembhavi, Christopher Clark

机构 * University of Pennsylvania(宾夕法尼亚大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00746 2025-05-07 cs.CV 57%

Entropy Heat-Mapping: Localizing GPT-Based OCR Errors with Sliding-Window Shannon Analysis

Alexei Kaltchenko

机构 * Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23667 2025-04-01 cs.CV 57%

Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity

Kotaro Inoue

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20085 2025-03-25 cs.CV 57%

Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language

Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15045 2025-03-20 cs.CV 57%

DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding

Wenhui Liao, Jiapeng Wang, Hongliang Li, Chengyu Wang, Jun Huang, Lianwen Jin

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13964 2025-03-19 cs.LG 57%

MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding

Siwei Han, Peng Xia, Ruiyi Zhang, Tong Sun, Yun Li, Hongtu Zhu, Huaxiu Yao

专题命中 文档图表理解 :vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04237 2025-03-12 cs.CV 57%

VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction

Jiahao Zhang, Ryota Yoshihashi, Shunsuke Kitada, Atsuki Osanai, Yuta Nakashima

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07209 2025-03-05 cs.CV 57%

MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance

Xierui Wang, Siming Fu, Qihan Huang, Wanggui He, Hao Jiang

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00591 2025-03-04 cs.CV 57%

AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models

Sohan Patnaik, Rishabh Jain, Balaji Krishnamurthy, Mausoom Sarkar

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments Accepted for publication in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15979 2025-02-25 cs.IR cs.CV 57%

Visual Zero-Shot E-Commerce Product Attribute Value Extraction

Jiaying Gong, Ming Cheng, Hongda Shen, Pierre-Yves Vandenbussche, Janet Jenq, Hoda Eldardiry

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 4 figures, accepted for publication in NAACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03163 2025-02-11 cs.CL cs.CV cs.CY 57%

Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Chenglei Si, Yanzhe Zhang, Ryan Li, Zhengyuan Yang, Ruibo Liu, Diyi Yang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments NAACL 2025; The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04223 2025-02-07 cs.CV 57%

Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents

Ilia Karmanov, Amala Sanjay Deshmukh, Lukas Voegtle, Philipp Fischer, Kateryna Chumachenko, Timo Roman, Jarno Seppänen, Jupinder Parmar, Joseph Jennings, Andrew Tao, Karan Sapra

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03692 2025-02-07 cs.LG cs.CL cs.CR 57%

DocMIA: Document-Level Membership Inference Attacks against DocVQA Models

Khanh Nguyen, Raouf Kerkouche, Mario Fritz, Dimosthenis Karatzas

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20613 2024-12-31 cs.CV 57%

Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study

Yulin Fei, Yuhui Gao, Xingyuan Xian, Xiaojin Zhang, Tao Wu, Wei Chen

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CoLing 2025 (The 31st International Conference on Computational Linguistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 57%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07895 2024-12-17 cs.CV cs.CL 57%

OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xucheng Yin, Cheng-lin Liu, Lianwen Jin, Xiang Bai

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02210 2024-12-11 cs.CV 57%

CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy

Zhibo Yang, Jun Tang, Zhaohai Li, Pengfei Wang, Jianqiang Wan, Humen Zhong, Xuejing Liu, Mingkun Yang, Peng Wang, Shuai Bai, LianWen Jin, Junyang Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

Comments 23 pages, 14 figures; The code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05311 2024-12-10 cs.AR cs.AI 57%

DRC-Coder: Automated DRC Checker Code Generation Using LLM Autonomous Agent

Chen-Chia Chang, Chia-Tung Ho, Yaguang Li, Yiran Chen, Haoxing Ren

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

Comments Proceedings of the 2025 International Symposium on Physical Design (ISPD '25), March 16--19, 2025, Austin, TX, USA

详情

展开后加载摘要…

URL PDF HTML 收藏