arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2502.01341 2025-11-04 cs.CL 50%

AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding

Ahmed Masry, Juan A. Rodriguez, Tianyu Zhang, Suyuchen Wang, Chao Wang, Aarash Feizi, Akshay Kalkunte Suresh, Abhay Puri, Xiangru Jian, Pierre-André Noël, Sathwik Tejaswi Madhusudhan, Marco Pedersoli, Bang Liu, Nicolas Chapados, Yoshua Bengio, Enamul Hoque, Christopher Pal, Issam H. Laradji, David Vazquez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow York University(约克大学) Mila – Quebec AI Institute(魁北克人工智能研究院) École de Technologie Supérieure(魁北克高等技术学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) CIFAR AI Chair(CIFAR人工智能 chair) Polytechnique Montréal(蒙特利尔理工学院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 文档图表理解 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15349 2025-10-21 cs.CL 50%

Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing

Baode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Haozhe Wang, Yanjie Liang, Ling Chen, Wei Chu, Yuan Qi

专题命中 文档图表理解 :vision-language model(abstract)

Comments This submission (arXiv:2510.15349) was mistakenly uploaded as a new article. It was intended to replace our previous work arXiv:2506.03197. All subsequent updates will be made to arXiv:2506.03197

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19312 2025-10-20 cs.IR 50%

DocMMIR: A Framework for Document Multi-modal Information Retrieval

Zirui Li, Siwei Wu, Yizhi Li, Xingyu Wang, Yi Zhou, Chenghua Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted for publication at EMNLP 2025 Findings. Code and data publicly available at https://github.com/J1mL1/DocMMIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23883 2025-09-30 cs.CL cs.IR 50%

DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning

Yibo Yan, Guangwei Xu, Xin Zou, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 文档图表理解 :vision-language model(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15432 2025-09-22 cs.IR 50%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07975 2025-08-12 cs.IR cs.CL 50%

Improving Document Retrieval Coherence for Semantically Equivalent Queries

Stefano Campese, Alessandro Moschitti, Ivano Lauriola

机构 * Amazon AGI(亚马逊人工智能研究院) University of Trento(特伦托大学)

专题命中 文档图表理解 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11935 2025-08-05 cs.CL 50%

ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs' Capability via Chart Editing

Xuanle Zhao, Xuexin Liu, Haoyue Yang, Xianzhen Luo, Fanhu Zeng, Jianling Li, Qi Shi, Chi Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments Accepted by ACL2025 Findings, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20726 2025-07-30 cs.RO 50%

ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making

Liu Dai, Haina Wang, Weikang Wan, Hao Su

专题命中 文档图表理解 :vision-language model(abstract)

Comments Project Website: https://manitaskgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16768 2025-06-23 cs.IR 50%

eSapiens: A Real-World NLP Framework for Multimodal Document Understanding and Enterprise Knowledge Processing

Isaac Shi, Zeyuan Li, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

专题命中 文档图表理解 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17374 2025-05-26 cs.HC cs.CL 50%

Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts

Seon Gyeom Kim, Jae Young Choi, Ryan Rossi, Eunyee Koh, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments This paper has been accepted to IEEE PacificVis 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07730 2025-05-13 cs.IR 50%

Reproducibility, Replicability, and Insights into Visual Document Retrieval with Late Interaction

Jingfen Qiao, Jia-Huei Ju, Xinyu Ma, Evangelos Kanoulas, Andrew Yates

专题命中 文档图表理解 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02466 2025-05-06 cs.IR 50%

Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality

Xueguang Ma, Luyu Gao, Shengyao Zhuang, Jiaqi Samantha Zhan, Jamie Callan, Jimmy Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments Accepted in SIGIR 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16688 2025-01-29 cs.CL 50%

MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark

Dongyi Yi, Guibo Zhu, Chenglin Ding, Zongshu Li, Dong Yi, Jinqiao Wang

专题命中 文档图表理解 :multimodal large language model(abstract)

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04026 2024-12-17 cs.CL 50%

M$^{3}$D: A Multimodal, Multilingual and Multitask Dataset for Grounded Document-level Information Extraction

Jiang Liu, Bobo Li, Xinran Yang, Na Yang, Hao Fei, Mingyao Zhang, Fei Li, Donghong Ji

专题命中 文档图表理解 :grounding(abstract)

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11251 2024-12-03 cs.IR 50%

Unifying Multimodal Retrieval via Document Screenshot Embedding

Xueguang Ma, Sheng-Chieh Lin, Minghan Li, Wenhu Chen, Jimmy Lin

专题命中 文档图表理解 :vision-language model(abstract)

Comments EMNLP2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17073 2024-11-26 cs.CL 50%

Enhancing Post-Hoc Attributions in Long Document Comprehension via Coarse Grained Answer Decomposition

Pritika Ramu, Koustava Goswami, Apoorv Saxena, Balaji Vasan Srinivasan

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16804 2024-10-23 cs.RO 50%

Combining Ontological Knowledge and Large Language Model for User-Friendly Service Robots

Haru Nakajima, Jun Miura

专题命中 文档图表理解 :visual language model(abstract)

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10160 2024-05-31 cs.CL 50%

Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning

Kung-Hsiang Huang, Mingyang Zhou, Hou Pong Chan, Yi R. Fung, Zhenhailong Wang, Lingyu Zhang, Shih-Fu Chang, Heng Ji

专题命中 文档图表理解 :vision-language model(abstract)

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04003 2024-04-08 cs.CL 50%

BuDDIE: A Business Document Dataset for Multi-task Information Extraction

Ran Zmigrod, Dongsheng Wang, Mathieu Sibue, Yulong Pei, Petr Babkin, Ivan Brugere, Xiaomo Liu, Nacho Navarro, Antony Papadimitriou, William Watson, Zhiqiang Ma, Armineh Nourbakhsh, Sameena Shah

专题命中 文档图表理解 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12191 2023-12-04 cs.CL 50%

Pointwise Mutual Information Based Metric and Decoding Strategy for Faithful Generation in Document Grounded Dialogs

Yatin Nandwani, Vineet Kumar, Dinesh Raghu, Sachindra Joshi, Luis A. Lastras

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10927 2023-11-07 cs.CL 50%

Causal Document-Grounded Dialogue Pre-training

Yingxiu Zhao, Bowen Yu, Haiyang Yu, Bowen Li, Jinyang Li, Chao Wang, Fei Huang, Yongbin Li, Nevin L. Zhang

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2023 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04592 2023-10-10 cs.CL cs.HC 50%

From Nuisance to News Sense: Augmenting the News with Cross-Document Evidence and Context

Jeremiah Milbauer, Ziqi Ding, Zhijin Wu, Tongshuang Wu

专题命中 文档图表理解 :grounding(abstract)

Comments EMNLP 2023 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.09486 2022-02-16 cs.CL 50%

Linking-Enhanced Pre-Training for Table Semantic Parsing

Bowen Qin, Lihan Wang, Binyuan Hui, Ruiying Geng, Zheng Cao, Min Yang, Jian Sun, Yongbin Li

专题命中 文档图表理解 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08609 2021-11-17 cs.CL 50%

Document AI: Benchmarks, Models and Applications

Lei Cui, Yiheng Xu, Tengchao Lv, Furu Wei

专题命中 文档图表理解 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.08426 2021-01-22 cs.CL 50%

Content Selection Network for Document-grounded Retrieval-based Chatbots

Yutao Zhu, Jian-Yun Nie, Kun Zhou, Pan Du, Zhicheng Dou

专题命中 文档图表理解 :grounding(abstract)

Comments ECIR 2021 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.04362 2019-06-12 cs.CL 50%

A Document-grounded Matching Network for Response Selection in Retrieval-based Chatbots

Xueliang Zhao, Chongyang Tao, Wei Wu, Can Xu, Dongyan Zhao, Rui Yan

专题命中 文档图表理解 :grounding(abstract)

Journal ref IJCAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏