arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2406.08707 2025-05-30 cs.CL cs.CV 70%

mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus

Matthieu Futeral, Armel Zebaze, Pedro Ortiz Suarez, Julien Abadji, Rémi Lacroix, Cordelia Schmid, Rachel Bawden, Benoît Sagot

机构 * Inria(法国国家信息与自动化技术研究院) Département d’informatique de l’ENS, CNRS, PSL Research University(巴黎高等师范学院计算机科学系、国家科学研究中心、巴黎综合理工研究学院) Institut du développement et des ressources en informatique scientifique, CNRS(科学信息发展与资源研究所、国家科学研究中心) Sorbonne Université(索邦大学) Common Crawl Foundation(Common Crawl基金会) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19554 2025-05-27 cs.CV 70%

Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation

Jiongchao Jin, Shengchu Zhao, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Agency for Science, Technology and Research(科技研究局)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01222 2025-05-23 cs.CV cs.CL 70%

Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG

Wenbin Wang, Yongcheng Jing, Liang Ding, Yingjie Wang, Li Shen, Yong Luo, Bo Du, Dacheng Tao

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 文档图表理解 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01457 2025-05-07 cs.IR cs.CV 70%

A Multi-Granularity Retrieval Framework for Visually-Rich Documents

Mingjun Xu, Zehui Wang, Hengxing Cai, Renxin Zhong

机构 * DP Technology(DP技术) School of Intelligent Systems Engineering, Sun Yat-Sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02971 2025-04-09 cs.CV cs.CL 70%

QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding

Binh M. Le, Shaoyuan Xu, Jinmiao Fu, Zhishen Huang, Moyan Li, Yanhui Guo, Hongdong Li, Sameera Ramasinghe, Bryan Wang

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 8 pages, accepted by CVPR 2025 MULA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00414 2025-04-02 cs.CL cs.AI cs.DL 70%

Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents

Gavin Greif, Niclas Griesshaber, Robin Greif

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18476 2025-03-26 cs.CV cs.CL 70%

Global-Local Tree Search in VLMs for 3D Indoor Scene Generation

Wei Deng, Mengshi Qi, Huadong Ma

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07589 2025-03-14 cs.CV 70%

DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation

Jianzong Wu, Chao Tang, Jingbo Wang, Yanhong Zeng, Xiangtai Li, Yunhai Tong

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments [CVPR 2025] The project page is https://jianzongwu.github.io/projects/diffsensei/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12358 2025-03-13 cs.CV cs.CL 70%

ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data

Yufan Shen, Chuwei Luo, Zhaoqing Zhu, Yang Chen, Qi Zheng, Zhi Yu, Jiajun Bu, Cong Yao

专题命中 文档图表理解 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01106 2025-03-04 cs.CV 70%

SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding

Jian Chen, Ruiyi Zhang, Yufan Zhou, Tong Yu, Franck Dernoncourt, Jiuxiang Gu, Ryan A. Rossi, Changyou Chen, Tong Sun

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12799 2025-02-19 cs.CL cs.CV cs.IR 70%

Towards Text-Image Interleaved Retrieval

Xin Zhang, Ziqi Dai, Yongqi Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Jun Yu, Wenjie Li, Min Zhang

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01577 2025-01-14 cs.CV 70%

EvoChart: A Benchmark and a Self-Training Approach Towards Real-World Chart Understanding

Muye Huang, Han Lai, Xinyu Zhang, Wenjun Wu, Jie Ma, Lingling Zhang, Jun Liu

专题命中 文档图表理解 :VLM(abstract);visual language model(abstract);分类 cs.CV

Comments This paper has been accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19101 2024-12-20 cs.CV 70%

DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming

Jiaxin Zhang, Wentao Yang, Songxuan Lai, Zecheng Xie, Lianwen Jin

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13046 2024-11-01 cs.CV 70%

MoVA: Adapting Mixture of Vision Experts to Multimodal Context

Zhuofan Zong, Bingqi Ma, Dazhong Shen, Guanglu Song, Hao Shao, Dongzhi Jiang, Hongsheng Li, Yu Liu

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09988 2024-10-17 cs.AI cs.CL cs.RO 70%

Details Make a Difference: Object State-Sensitive Neurorobotic Task Planning

Xiaowen Sun, Xufeng Zhao, Jae Hee Lee, Wenhao Lu, Matthias Kerzel, Stefan Wermter

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments ICANN24, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21333 2024-08-01 cs.CV 70%

Chat2Layout: Interactive 3D Furniture Layout with a Multimodal LLM

Can Wang, Hongliang Zhong, Menglei Chai, Mingming He, Dongdong Chen, Jing Liao

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Main paper with supplemental materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16635 2024-04-26 cs.CV 70%

TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning

Liang Zhang, Anwen Hu, Haiyang Xu, Ming Yan, Yichen Xu, Qin Jin, Ji Zhang, Fei Huang

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05225 2024-04-09 cs.CV cs.CL 70%

LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding

Chuwei Luo, Yufan Shen, Zhaoqing Zhu, Qi Zheng, Zhi Yu, Cong Yao

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05080 2026-07-28 q-fin.TR 版本更新 67%

MM-ARC: Multimodal Adaptive Routing of Capital with Robustness-Audited Strategy Pools

MM-ARC:具有稳健性审核策略池的资本多模态自适应路由

Yang Chen, Yuchen Cao, Jacky Keung, Leilei Gan, Kun Kuang, Yueheng Jiang, Zhaozhao Ma, Jianping Zhu, Fei Wu, Jinpeng Li

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

AI总结 研究金融交易系统如何转化多模态市场历史,提出MM-ARC方法,通过多视图在不同专家间分配资本,经稳健性审核筛选候选方案,实验显示该方法在夏普比率和最大回撤等指标上优于基线,有相对基准的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10384 2026-06-17 cs.CL 版本更新 67%

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

当表格失控:评估多模态模型在法语金融文档上的表现

Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah

机构 * Inria Paris(巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Scribe Finance基准,评估多模态模型在法语金融文档上的文本、表格、图表及多轮对话理解能力,发现模型在图表和多轮对话中表现脆弱。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 67%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02014 2026-06-08 cs.CV cs.AI cs.CL cs.LG 版本更新 67%

Rethinking Genomic Modeling Through Optical Character Recognition

通过光学字符识别重新思考基因组建模

Hongxin Xiang, Pengsen Ma, Yunkang Cao, Di Yu, Haowen Chen, Xinyu Yang, Xiangxiang Zeng

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出OpticalDNA框架,将DNA渲染为视觉布局,利用视觉语言模型进行OCR式基因组理解,实现高保真压缩和长序列高效处理,在450k碱基序列上以近20倍更少有效token超越基线模型。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28874 2026-05-29 cs.CL 67%

From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization

从数据到洞察:探索程序化思维提示在图表摘要中的应用

Yutong Qu, Wei Zhang

机构 * Adelaide University(阿德莱德大学)

专题命中 文档图表理解 :VLM(abstract_cn);visual language model(abstract)

AI总结 本文提出一种零样本学习方法,通过Python程序作为中介,利用程序化思维策略驱动轻量级视觉语言模型进行图表摘要,并引入图表到字典的辅助任务以提高灵活性和性能。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19961 2026-03-24 cs.CL cs.IR 67%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03262 2026-01-08 cs.IR cs.CL 67%

Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey

多模态大语言模型在视觉丰富文档检索中的作用:一项综述

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract)

AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。

Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10552 2025-11-14 cs.CL 67%

URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding

Yongxin Shi, Jiapeng Wang, Zeyu Shan, Dezhi Peng, Zening Lin, Lianwen Jin

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03197 2025-10-22 cs.CV cs.AI cs.CL cs.LG 67%

Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing

Baode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Haozhe Wang, Yanjie Liang, Ling Chen, Wei Chu, Yuan Qi

机构 * INFLY Tech(INFLY科技) Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07666 2025-09-10 cs.CL cs.IR 67%

MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval

Xixi Wu, Yanchao Tan, Nan Hou, Ruiyang Zhang, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Fuzhou University(福州大学) University of Macau(澳门大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

Comments EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09450 2025-08-14 cs.CL 67%

From Charts to Fair Narratives: Uncovering and Mitigating Geo-Economic Biases in Chart-to-Text

Ridwan Mahbub, Mohammed Saidul Islam, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Mizanur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University, Canada(约克大学,加拿大) University of Alberta, Canada(阿尔伯塔大学,加拿大) Dialpad Inc., Canada(Dialpad公司,加拿大) RBC, Canada(RBC,加拿大) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Salesforce AI, USA(Salesforce AI,美国)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03560 2025-08-06 cs.SE 67%

LaTCoder: Converting Webpage Design to Code with Layout-as-Thought

Yi Gui, Zhen Li, Zhongyi Zhang, Guohao Wang, Tianpeng Lv, Gaoyang Jiang, Yi Liu, Dongping Chen, Yao Wan, Hongyu Zhang, Wenbin Jiang, Xuanhua Shi, Hai Jin

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)

Comments KDD 2025 v2

详情

展开后加载摘要…

URL PDF HTML 收藏