arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2509.18189 2025-09-24 cs.CV cs.AI 81%

Qianfan-VL: Domain-Enhanced Universal Vision-Language Models

Daxiang Dong, Mingming Zheng, Dong Xu, Bairong Zhuang, Wenyu Zhang, Chunhua Luo, Haoran Wang, Zijian Zhao, Jie Li, Yuxuan Li, Hanjun Zhong, Mengyue Liu, Jieting Chen, Shupeng Li, Lun Tian, Yaping Feng, Xin Li, Donggang Jiang, Yong Chen, Yehua Xu, Duohao Qin, Chen Feng, Dan Wang, Henghua Zhang, Jingjing Ha, Jinhui He, Yanfeng Zhai, Chengxin Zheng, Jiayi Mao, Jiacheng Chen, Ruchang Yao, Ziye Yuan, Jianmin Wu, Guangjun Xie, Dou Shen

机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)

专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17481 2025-09-23 cs.CV cs.AI cs.CL 81%

ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding

Xingqi Wang, Yiming Cui, Xin Yao, Shijin Wang, Guoping Hu, Xiaoyu Qin

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) State Key Laboratory of Cognitive Intelligence, iFLYTEK(认知智能国家重点实验室)

专题命中 文档图表理解 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16524 2025-07-23 cs.CV cs.AI 81%

Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models

Xiaoyan Wang, Zeju Li, Yifan Xu, Jiaxing Qi, Zhifei Yang, Ruifei Ma, Xiangde Liu, Chao Zhang

机构 * Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究中心) The Chinese University of Hong Kong(香港中文大学)

专题命中 文档图表理解 :vision-language model(title);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01048 2025-07-17 cs.CV cs.CR cs.LG 81%

How does Watermarking Affect Visual Language Models in Document Understanding?

Chunxue Xu, Yiwei Wang, Bryan Hooi, Yujun Cai, Songze Li

机构 * Southeast University, China(东南大学) University of California, Merced, USA(加州大学默塞德分校) National University of Singapore, Singapore(新加坡国立大学) The University of Queensland, Australia(昆士兰大学)

专题命中 文档图表理解 :visual language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08309 2025-07-14 cs.CL cs.AI cs.CV 81%

Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency

Yupu Liang, Yaping Zhang, Zhiyang Zhang, Zhiyuan Chen, Yang Zhao, Lu Xiang, Chengqing Zong, Yu Zhou

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02295 2025-06-04 cs.CV cs.AI 81%

QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation

Ahmed Wasfy, Omer Nacar, Abdelakreem Elkhateb, Mahmoud Reda, Omar Elshehy, Adel Ammar, Wadii Boulila

机构 * NAMAA KAND CA Corp. Prince Sultan University

专题命中 文档图表理解 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19714 2025-05-27 cs.CL cs.AI cs.LG 81%

MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning

Zhaopeng Feng, Yupu Liang, Shaosheng Cao, Jiayuan Su, Jiahan Ren, Zhe Xu, Yao Hu, Wenxuan Huang, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学)

专题命中 文档图表理解 :MLLM(title,abstract);分类 cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11492 2025-05-27 cs.AI cs.CL cs.CV 81%

Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding

Kung-Hsiang Huang, Can Qin, Haoyi Qiu, Philippe Laban, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) UCLA(加州大学洛杉矶分校)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Code and data are available at https://github.com/SalesforceAIResearch/CogAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13945 2025-05-20 cs.LG cs.AI 81%

Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models

Zhanglin Wu, Tengfei Song, Ning Xie, Mengli Zhu, Weidong Zhang, Shuang Wu, Pengfei Li, Chong Li, Junhao Zhu, Hao Yang, Shiliang Sun

机构 * Institution1(机构1) Institution2(机构2)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 12 pages, 5 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08378 2025-05-01 cs.CV cs.AI 81%

FILA: Fine-Grained Vision Language Models

Shiding Zhu, Wenhui Dong, Jun Song, Yingbo Wang, Yanan Guo, Bo Zheng

机构 * Zhejiang University(浙江大学) Taobao & Tmall Group of Alibaba(阿里巴巴集团) USTC(中国科学技术大学)

专题命中 文档图表理解 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 4 figures, accepted to ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17315 2025-04-25 cs.CV cs.AI 81%

DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model

Zhanglin Wu, Tengfei Song, Ning Xie, Weidong Zhang, Pengfei Li, Shuang Wu, Chong Li, Junhao Zhu, Hao Yang

机构 * Huawei Translation Service Center(华为翻译服务中心)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 7 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16061 2025-04-23 cs.CV cs.AI 81%

Vision language models are unreliable at trivial spatial cognition

Sangeet Khemlani, Tyler Tran, Nathaniel Gyory, Anthony M. Harrison, Wallace E. Lawson, Ravenna Thielstrom, Hunter Thompson, Taaren Singh, J. Gregory Trafton

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02193 2025-03-12 cs.CV cs.AI 81%

LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models

Fan-Yun Sun, Weiyu Liu, Siyi Gu, Dylan Lim, Goutam Bhat, Federico Tombari, Manling Li, Nick Haber, Jiajun Wu

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments CVPR 2025, project website: https://ai.stanford.edu/~sunfanyun/layoutvlm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21311 2024-10-30 cs.CV cs.AI 81%

MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding

Fengbin Zhu, Ziyang Liu, Xiang Yao Ng, Haohui Wu, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Tat Seng Chua

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10434 2023-10-24 cs.CL cs.AI cs.LG 81%

Learning the Visualness of Text Using Large Vision-Language Models

Gaurav Verma, Ryan A. Rossi, Christopher Tensmeyer, Jiuxiang Gu, Ani Nenkova

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at EMNLP 2023 (Main, long); 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05938 2026-08-04 cs.AI 版本更新 79%

ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

ICU-Bench: 多模态大语言模型持续反学习基准测试

Yuhang Wang, Wenjie Mei, Junkai Zhang, Guangyu He, Zhenxing Niu, Haichang Gao

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。

Comments 21 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25021 2026-07-29 cs.AI cs.HC cs.MA cs.SE 新提交 79%

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明

Ishrat Jahan Eliza, Md Dilshadur Rahman

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。

Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22723 2026-07-28 cs.CV 新提交 79%

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

通过分类引导的大型视觉语言模型从文档中提取视觉信息

Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li

机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司) School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究从视觉丰富文档提取视觉信息的挑战,提出分类引导大型视觉语言模型框架,通过解耦分类与提取、运用动态提示工程实现零样本推理,在真实数据集上性能超监督基线,为办公自动化文档理解提供高效方案。

Comments 14 pages, 3 figures

Journal ref Scientific Reports 16, 14158 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21617 2026-07-27 cs.AI cs.CL 新提交 79%

Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models

视觉语言模型是读取还是重写?论视觉语言模型中的转录忠实性

Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis

专题命中 文档图表理解 :vision-language model(title);vision language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型在文档理解中是否忠实转录。引入FaithC4基准,评估通用、OCR专用VLMs及传统OCR管道。发现通用VLMs受扰WER降4.5分,OCR专用降0.2 - 2分,传统OCR降不到0.6分。还揭示重写与FFN表示及单词长度的关系。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 79%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02853 2026-07-07 cs.CV cs.SE 新提交 79%

Prior Bias in Vision Language Models on UML Diagram Interpretation

视觉语言模型在UML图解释中的先验偏差

Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio Mastropaolo

机构 * Dept. of Computer Science(计算机科学系) William & Mary, USA(威廉玛丽学院)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型在UML图解释时是依据先验知识还是真正理解图表。通过引入对比基准测试,评估多个模型,发现反转关系箭头会降低开源模型关系方向准确率,不同模型表现有差异,揭示先验驱动的理解故障。

Comments 16 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05412 2026-06-02 cs.CV cs.CL 79%

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

视觉-语言模型将头部方向误认为注视方向:非语言对话线索

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Emory University(埃默里大学) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC San Diego(圣地亚哥大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。

Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28103 2026-05-21 cs.DL cs.AI cs.IR 79%

Transcription and Recognition of Italian Parliamentary Speeches Using Vision-Language Models

使用视觉-语言模型进行意大利议会演讲的转录与识别

Luigi Curini, Alfio Ferrara, Giovanni Pagano, Sergio Picascia

机构 * Università degli Studi di Milano(米兰大学) Department of Social and Political Sciences(社会科学系) Department of Literary Studies, Philology and Linguistics(文学研究、语言学与语言学系) Department of Computer Science(计算机科学系)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言模型的 pipeline,用于自动转录、语义分割和实体链接意大利议会演讲,提升转录质量和发言者标注。

Comments to be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16161 2026-04-22 cs.CV cs.CL 79%

OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models

OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性

Wenwen Yu, Zhibo Yang, Jianqiang Wan, Sibo Song, Jun Tang, Wenqing Cheng, Yuliang Liu, Xiang Bai

机构 * School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出OmniParser V2,通过结构化思维点提示方案统一视觉文本解析任务,简化流程并提升性能,在多个数据集上取得最佳结果,并验证其在多模态大语言模型中的通用性。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV 79%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05793 2026-04-08 cs.CR cs.CV 79%

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

BodhiPromptShield: 预推理提示调解用于抑制LLM/VLM代理中的隐私传播

Bo Ma, Jinsong Wu, Weiqi Yan

机构 * Auckland University of Technology(奥克兰理工大学) University of Chile(智利大学)

专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV

AI总结 本文提出BodhiPromptShield框架,通过检测敏感片段、路由和延迟恢复来抑制LLM/VLM代理中的跨阶段隐私传播,实验显示在控制提示隐私基准(CPPB)上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23095 2026-04-07 cs.CV 79%

Revisiting Multimodal Positional Encoding in Vision-Language Models

重新审视视觉-语言模型中的多模态位置编码

Jie Huang, Xuejing Liu, Sibo Song, Ruibing Hou, Hong Chang, Junyang Lin, Shuai Bai

机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21957 2026-04-06 cs.CV 79%

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

PaddleOCR-VL-1.5:迈向一个鲁棒的多任务0.9B视觉语言模型用于野外文档解析

Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV

AI总结 PaddleOCR-VL-1.5通过引入Real5-OmniDocBench基准测试,在文档解析任务中达到94.5%的SOTA准确率,并扩展了密封识别和文本定位任务,同时保持0.9B超紧凑模型的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13580 2026-03-31 cs.CV cs.HC 79%

AltChart: Enhancing VLM-based Chart Summarization Through Multi-Pretext Tasks

AltChart: 通过多预训练任务增强基于视觉语言模型的图表摘要

Omar Moured, Jiaming Zhang, M. Saquib Sarfraz, Rainer Stiefelhagen

专题命中 文档图表理解 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出AltChart数据集和方法,通过多预训练任务提升VLM在图表摘要中的表现,评估四种主流模型的可访问性。

Comments Concerns about reproducibility of the train results and dataset availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24373 2026-03-26 cs.CV 79%

PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡

Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu

机构 * PaddlePaddle Team(PaddlePaddle团队) Baidu Inc(百度公司)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏