arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2603.24649 2026-05-14 cs.CV 70%

MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows

MedOpenClaw 和 MedFlowBench:在完整研究流程中审计医疗代理

Weixiang Shen, Chengzhi Shen, Yanzhu Hu, Che Liu, Junde Wu, Jiayuan Zhu, Xiao Han, Zongyue Li, Jingpei Wu, Min Xu, Daguang Xu, Yueming Jin, Benedikt Wiestler, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) Imperial College London(伦敦帝国理工学院) University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(NVIDIA公司) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出 MedFlowBench 和 MedOpenClaw,用于评估医疗影像代理在完整研究流程中生成可审计证据的能力,发现仅依赖答案评分不够,需结合正确证据验证。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 70%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 70%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17188 2026-04-14 cs.AI 70%

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26784 2026-03-31 cs.CV 70%

HighlightBench: Benchmarking Markup-Driven Table Reasoning in Scientific Documents

HighlightBench:科学文档中基于标记的表格推理基准测试

Lexin Wang, Shenghua Liu, Yiwei Wang, Yujun Cai, Yuyao Ge, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) University of Queensland(昆士兰大学)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出HighlightBench,用于评估文档中基于标记的表格推理能力,通过五个任务家族分解评估,并提供可复现的基准流程,揭示模型在视觉提示与符号推理一致性下的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25293 2026-03-27 cs.AI cs.CL 70%

DAGverse: Building Document-Grounded Semantic DAGs from Scientific Papers

DAGverse: 从科学论文构建文档导向的语义DAG

Shu Wan, Saketh Vishnubhatla, Iskander Kushbay, Tom Heffernan, Aaron Belikoff, Raha Moraffah, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出DAGverse框架,通过科学论文中的显式DAG图和文本上下文,自动构建文档导向的语义DAG,提升DAG分类和标注的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 70%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13398 2026-03-17 cs.CV 70%

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

千帆OCR:一种统一的端到端模型用于文档智能

Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

机构 * Baidu Qianfan Team(百度千帆团队)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 千帆OCR是一种端到端视觉-语言模型,整合文档解析、布局分析和文档理解,支持图像到Markdown转换及多种提示驱动任务,通过Layout-as-Thought机制提升复杂布局的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 70%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07936 2026-03-10 cs.CV 70%

Text to Automata Diagrams: Comparing TikZ Code Generation with Direct Image Synthesis

文本到自动机图:比较TikZ代码生成与直接图像合成

Ethan Young, Zichun Wang, Aiden Taylor, Chance Jewell, Julian Myers, Satya Sri Rajiteswari Nimmagadda, Anthony White, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 文档图表理解 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

AI总结 本研究比较了通过视觉-语言模型生成TikZ代码与直接图像合成在生成自动机图描述中的效果,发现人工修正能显著提高生成准确性。

Comments Accepted to ASEE North Central Section 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02789 2026-03-04 cs.CL cs.AI 70%

OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets

OCR 或不是?在 MLLMs 时代重新思考文档信息提取:基于真实世界的大规模数据集

Jiyuan Shen, Peiyue Yuan, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

机构 * SAP(SAP公司) Stanford University(斯坦福大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了在 MLLMs 时代是否仍需 OCR,通过大规模数据集评估发现,仅图像输入可达到与 OCR 增强方法相当的性能,并展示了通过精心设计的模式、示例和指示可进一步提升 MLLMs 的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI 70%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01840 2026-03-03 cs.CV eess.IV 70%

FireRed-OCR Technical Report

FireRed-OCR 技术报告

Hao Wu, Haoran Lou, Xinyue Li, Zuodong Zhong, Zhaojun Sun, Phellon Chen, Xuanhe Zhou, Kai Zuo, Yibo Chen, Xu Tang, Yao Hu, Boxiang Zhou, Jian Wu, Yongji Wu, Wenxin Yu, Yingmiao Liu, Yuhao Huang, Manjie Xu, Gang Liu, Yidong Ma, Zhichao Sun, Changhao Qiao

机构 * Super Intelligence Team(超级智能团队) Xiaohongshu Inc(小红书公司)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14381 2026-02-16 cs.AI 70%

SCAN: Semantic Document Layout Analysis for Textual and Visual Retrieval-Augmented Generation

SCAN:面向文本和视觉检索增强生成的语义文档布局分析

Nobuhiro Ueda, Yuyang Dong, Krisztián Boros, Daiki Ito, Takuya Sera, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 SCAN通过语义文档布局分析提升文本和视觉检索增强生成的性能,实验显示在英语和日语数据集上分别提升9.4和10.4个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04365 2026-02-05 cs.LG 70%

EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets

EXaMCaP: 通过熵增最大化进行子集选择以探测大规模图表理解训练集的探测能力提升

Jiapeng Liu, Liang Li, Bing Li, Peng Fu, Xiyan Gao, Chengyang Fang, Xiaoshuai Hao, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Computer and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 EXaMCaP通过熵增最大化选择子集,以高效探测大规模图表理解训练集的能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 70%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08922 2025-12-10 cs.CV 70%

Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration

统一扩散变压器用于高质量文本感知图像恢复

Jin Hyeon Kim, Paul Hyunbin Cho, Claire Kim, Jaewon Min, Jaeeun Lee, Jihye Park, Yeji Choi, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Samsung Electronics(三星电子)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 UniT通过整合扩散变压器、视觉-语言模型和文本识别模块,实现高质量文本感知图像恢复,有效抑制文本幻觉并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 70%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03928 2025-11-27 cs.CV 70%

Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling

Vision Remember: 在高效的LVLM中通过视觉特征采样恢复视觉信息

Ze Feng, Jiang-jiang Liu, Sen Yang, Lingyu Xiao, Zhibin Quan, Zhenhua Feng, Wankou Yang, Jingdong Wang

机构 * Southeast University(东南大学) Baidu VIS(百度视觉) The University of Hong Kong(香港大学) Jiangnan University(江南大学)

专题命中 文档图表理解 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 Vision Remember通过视觉特征采样在高效LVLM中恢复视觉信息,提升效率并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13283 2025-11-18 cs.CV 70%

TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing

Jongha Kim, Minseong Bae, Sanghyeok Lee, Jinsung Yoon, Hyunwoo J. Kim

机构 * Korea University(韩国大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07722 2025-11-13 cs.AI 70%

Is Cognition Consistent with Perception? Assessing and Mitigating Multimodal Knowledge Conflicts in Document Understanding

Zirui Shao, Feiyu Gao, Zhaoqing Zhu, Chuwei Luo, Hangdi Xing, Zhi Yu, Qi Zheng, Ming Yan, Jiajun Bu

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and DataSecurity(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19817 2025-10-23 cs.CV cs.CL 70%

olmOCR 2: Unit Test Rewards for Document OCR

Jake Poznanski, Luca Soldaini, Kyle Lo

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments https://olmocr.allen.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07545 2025-10-13 cs.CL cs.LG 70%

Deploying Tiny LVLM Judges for Real-World Evaluation of Chart Models: Lessons Learned and Best Practices

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Ridwan Mahbub, Mizanur Rahman, Amran Bhuiyan, Israt Jahan, Mir Tafseer Nayeem, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Salesforce AI Research(Salesforce AI研究)

专题命中 文档图表理解 :vision-language model(abstract);LLaVA(abstract);分类 cs.LG

Comments Accepted to the EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17589 2025-09-23 cs.AI 70%

Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models

Jun Ling, Yao Qi, Tao Huang, Shibo Zhou, Yanqin Huang, Jiang Yang, Ziqi Song, Ying Zhou, Yang Yang, Heng Tao Shen, Peng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Research Center for Scientific Data Hub, Zhejiang Lab, Hangzhou, China(浙江实验室科学数据中心研究中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03615 2025-09-05 cs.CL cs.AI 70%

E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition

Aryan Gupta, Anupam Purwar

机构 * Sprinklr

专题命中 文档图表理解 :vision-language model(abstract);InternVL(abstract);分类 cs.AI

Comments Sprinklr OCR provides a fast and compute light way of performing OCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18984 2025-08-29 cs.CV 70%

Enhancing Document VQA Models via Retrieval-Augmented Generation

Eric López, Artemis Llabrés, Ernest Valveny

机构 * Computer Vision Center, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机视觉中心)

专题命中 文档图表理解 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14316 2025-08-29 cs.CV 70%

T-Stars-Poster: A Framework for Product-Centric Advertising Image Design

Hongyu Chen, Min Zhou, Jing Jiang, Jiale Chen, Yang Lu, Zihang Lin, Bo Xiao, Tiezheng Ge, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文档图表理解 :VLM(abstract);visual language model(abstract);分类 cs.CV

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17079 2025-08-26 cs.IR cs.AI 70%

Zero-shot Multimodal Document Retrieval via Cross-modal Question Generation

Yejin Choi, Jaewoo Park, Janghan Yoon, Saejin Kim, Jaehyun Jeon, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11435 2025-08-05 cs.CV 70%

GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts

Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Chenyang Li, Hanyuan Chen, Jin-Peng Lan, Bin Luo, Yifeng Geng

机构 * Dalian University of Technology(大连理工大学) Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20424 2025-07-24 cs.RO cs.AI cs.SY eess.SY 70%

Robot Operation of Home Appliances by Reading User Manuals

Jian Zhang, Hanbo Zhang, Anxing Xiao, David Hsu

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏