arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2607.03836 2026-07-07 cs.CV cs.AI cs.CL 新提交 79%

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

何时越简单越好:评估中世纪拉丁文手稿的翻译管道

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud

机构 * Eötvös Loránd University(厄特沃什·罗兰大学) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 针对历史手稿翻译难题,提出评估中世纪拉丁文手稿图像到翻译流程的框架。通过CATMuS数据集对比发现领域特定OCR模型优势,引入新数据集IPC,实验揭示简单管道表现更佳,为低资源历史场景翻译系统部署提供基准与指导。

Comments 17 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 79%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25838 2026-06-25 cs.CV cs.AI 新提交 79%

Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines

边缘先于嵌入:面向视觉语言管线的置信感知模糊门控

Duy Tran Thanh

机构 * OneMount Group(OneMount集团)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MagikaDocumentFromPixel轻量级图像质量门控,通过边缘先验模块和置信感知路由,在7ms内分类图像清晰度,F1达0.9803。

Comments 7 pages, 2 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11477 2026-06-11 cs.CV cs.AI 新提交 79%

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

迈向全自动考试评分:基于基础模型的笔迹答案公平性识别

Hartwig Grabowski

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University(奥芬堡大学机器学习和分析研究所(IMLA))

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出使用视觉-语言基础模型(VLM)识别手写答案,在61份考试(3141个答案位置)上达到98.4%准确率,并通过轻量提示将假阴性率降至0.58%,实现公平的全自动评分。

Comments 11 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11307 2026-05-13 cs.CV cs.LG 79%

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

Vision2Code:一个多领域评估图像到代码生成的基准

Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Vision2Code提出一个无需参考代码的多领域图像到代码生成评估框架,通过2169个测试示例评估模型生成代码的质量,发现性能依赖于领域,且通过筛选器的模型输出可提升生成能力。

Comments Project page: https://image2code.github.io/vision2code/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 79%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14035 2025-06-18 cs.CV cs.AI 79%

SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement

Chelsi Jain, Yiran Wu, Yifan Zeng, Jiale Liu, S hengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) AG2AI, Inc.(AG2AI公司) Johnson & Johnson(强生公司)

专题命中 文档图表理解 :VLM(abstract);visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10408 2026-08-12 cs.CL 新提交 78%

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?

Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 78%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06532 2026-08-10 cs.CL 新提交 78%

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

面向图表与文档理解的金融视觉语言模型的置信度估计

Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学) JPMorgan AI Research(摩根大通AI研究院)

专题命中 文档图表理解 :vision-language model(title);grounding(abstract)

AI总结 该研究针对金融视觉语言模型,评估7种置信度估计器的分布外迁移效果,发现仅训练得到的探测模型具备校准能力,其中接地感知探测模型可区分模型未使用图表生成的答案与流畅猜测,为金融场景的决策信任提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-06-11 cs.CL 版本更新 78%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文档图表理解 :multimodal large language model(title,abstract)

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 78%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15769 2026-02-18 cs.CL 78%

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

ViTaB-A:在视觉表格归因上评估多模态大语言模型

Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 文档图表理解 :multimodal large language model(title,abstract)

AI总结 ViTaB-A研究了多模态大语言模型在视觉表格归因中的表现,发现其在证据归因方面存在显著缺陷,影响透明性和可追溯性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18004 2025-12-23 cs.CV cs.AI cs.CL cs.LG 78%

Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models

清晰地看见正义:结合OCR和视觉-语言模型的 handwritten 法律文件翻译

Shubham Kumar Nigam, Parjanya Aditya Shukla, Noel Shallum, Arnab Bhattacharya

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉大语言模型统一OCR与机器翻译流程,以提升低资源环境下手写法律文件的翻译效率和准确性。

Comments Accepted in AILaw @ AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23066 2025-10-28 cs.IR 78%

Multi-Stage Field Extraction of Financial Documents with OCR and Compact Vision-Language Models

Yichao Jin, Yushuo Wang, Qishuai Zhong, Kent Chiu Jin-Chun, Kenneth Zhu Ke, Donald MacDonald

专题命中 文档图表理解 :vision-language model(title);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04041 2025-09-29 cs.CE 78%

StockGenChaR: A Study on the Evaluation of Large Vision-Language Models on Stock Chart Captioning

Le Qiu, Emmanuele Chersoni

专题命中 文档图表理解 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09731 2025-09-15 cs.CL 78%

Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning

Haiyang Yu, Yuchuan Wu, Fan Shi, Lei Liao, Jinghui Lu, Xiaodong Ge, Han Wang, Minghan Zhuo, Xuecheng Wu, Xiang Fei, Hao Feng, Guozhi Tang, An-Lan Wang, Hanshen Zhu, Yangfan He, Quanhuan Liang, Liyuan Meng, Chao Feng, Can Huang, Jingqun Tang, Bin Li

专题命中 文档图表理解 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05263 2025-09-09 cs.AI cs.CV cs.LG 78%

LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation

Yinglin Duan, Zhengxia Zou, Tongwei Gu, Wei Jia, Zhan Zhao, Luyi Xu, Xinzhu Liu, Yenan Lin, Hao Jiang, Kang Chen, Shuang Qiu

机构 * NetEase, Inc.(网易公司) Beihang University(北京航空航天大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Independent Researcher & Technical Artists(独立研究者及技术艺术家)

专题命中 文档图表理解 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09716 2025-08-14 cs.CL 78%

The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 文档图表理解 :vision-language model(title,abstract)

Comments Accepted to IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08452 2025-05-02 cs.IR 78%

KAP: MLLM-assisted OCR Text Enhancement for Hybrid Retrieval in Chinese Non-Narrative Documents

Hsin-Ling Hsu, Ping-Sheng Lin, Jing-Di Lin, Jengnan Tzeng

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11403 2025-02-03 cs.CL cs.IR cs.MM 78%

Verifying Cross-modal Entity Consistency in News using Vision-language Models

Sahar Tahmasebi, David Ernst, Eric Müller-Budack, Ralph Ewerth

专题命中 文档图表理解 :vision-language model(title,abstract)

Comments Accepted for publication in: European Conference on Information Retrieval (ECIR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01430 2023-08-04 cs.CL 78%

FinVis-GPT: A Multimodal Large Language Model for Financial Chart Analysis

Ziao Wang, Yuhang Li, Junda Wu, Jaehyeon Soon, Xiaofeng Zhang

专题命中 文档图表理解 :multimodal large language model(title,abstract)

Comments (FinLLM 2023)@IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22200 2026-07-27 cs.CV 新提交 77%

LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

LayoutLite:用于高效文档OCR的令牌级隐式布局分析

Xudong Liu, Bicheng Wan, Yulin Jin

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究基于视觉语言模型的端到端OCR系统效率问题,提出LayoutLite模块,通过令牌级隐式布局分析,聚合视觉表示并预测重要性分数,去除低信息令牌,实验证明其能有效加速OCR系统,提升效率且保证识别质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29655 2026-07-08 cs.CV cs.GR 版本更新 77%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01609 2026-07-03 cs.LG 新提交 77%

SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence

SINA: 一种使用人工智能的全自动电路原理图图像到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Mohammed Ayman Habib, Finn Murphy, Rishen Cao, Morteza Fayazi

机构 * The Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系) The Department of Electrical, Computer & Energy Engineering, University of Colorado Boulder(科罗拉多大学博尔德分校电气、计算机与能源工程系)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 提出SINA,一种全自动开源流水线,集成深度学习、连通分量标记、OCR和视觉语言模型,实现从电路原理图图像到网表的转换,在IC和PCB级别均达到96.67%的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02803 2026-06-17 cs.CV 版本更新 77%

Structure-Aware Text Recognition for Ancient Greek Critical Editions

面向古希腊校勘本的结构感知文本识别

Nicolas Angleraud, Antonia Karamolegkou, Benoît Sagot, Thibault Clérice

机构 * Inria(法国国家信息与自动化技术研究所)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);visual language model(abstract);分类 cs.CV

AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12898 2026-06-12 cs.CV cs.CL 新提交 77%

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

放大关键信息:面向视觉文本理解的注意力引导自适应渲染

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

机构 * Michigan State University(密歇根州立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22192 2026-06-10 cs.CV 版本更新 77%

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09578 2026-06-09 cs.AI cs.CL cs.IR 新提交 77%

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 文档图表理解 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。

Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25956 2026-06-05 cs.CV 77%

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+: 一种基于视觉的视觉-语言框架,用于提高自动化癌症转诊处理中的临床信任度和可审计性

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Adam Byfield, Lukman Akanbi, Muhammad Bilal

机构 * Birmingham City University(伯明翰城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University Hospitals Birmingham NHS Foundation Trust(伯明翰大学医院 NHS 基础信托) NHS England(英格兰国家卫生服务体系)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出RAPTOR+多模态框架,通过微调视觉-语言模型实现端到端转诊理解,在结直肠癌转诊表单上显著提升提取准确性和证据定位能力。

Comments 12 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏