arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2603.07119 2026-03-10 cs.CV 57%

TIQA: Human-Aligned Text Quality Assessment in Generated Images

TIQA: 生成图像中的人工对齐文本质量评估

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova

机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03302 2026-03-05 cs.CL cs.AI cs.IR 57%

Developing an AI Assistant for Knowledge Management and Workforce Training in State DOTs

为州交通部门的知识管理和员工培训开发人工智能助手

Divija Amaram, Lu Gao, Gowtham Reddy Gudla, Tejaswini Sanjay Katale

机构 * Department of Computer Science, University of Houston(计算机科学系,休斯顿大学) Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Ph.D Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Engineering Data Science, University of Houston(工程数据科学,休斯顿大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种多代理架构的RAG框架,用于州交通部门的知识管理和决策支持,通过整合文档检索与大语言模型生成,提升信息检索与响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00476 2026-03-03 cs.CR cs.AI 57%

Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents

代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞

Linxi Jiang, Zhijie Liu, Haotian Luo, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21824 2026-02-26 cs.LG 57%

DocDjinn: Controllable Synthetic Document Generation with VLMs and Handwriting Diffusion

DocDjinn: 基于VLMs和手写扩散的可控合成文档生成

Marcel Lamott, Saifullah Saifullah, Nauman Riaz, Yves-Noel Weweler, Tobias Alt-Veit, Ahmad Sarmad Ali, Muhammad Armaghan Shakir, Adrian Kalwa, Momina Moetesum, Andreas Dengel, Sheraz Ahmed, Faisal Shafait, Ulrich Schwanecke, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) DeepReader GmbH(DeepReader公司) Insiders Technologies GmbH(Insiders Technologies公司) National University of Sciences and Technology(国家科学与技术大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG

AI总结 DocDjinn利用VLMs和手写扩散生成可控合成文档,通过聚类和参数化采样从未标注种子生成高质量标注文档,实现隐私保护和高效数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 57%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19193 2026-02-24 cs.RO cs.AI 57%

Visual Prompt Guided Unified Pushing Policy

基于视觉提示的统一推送策略

Hieu Bui, Ziyan Gao, Yuya Hosoda, Joo-Ho Lee

机构 * Graduate School of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程研究生院) Japan Advanced Institute of Science and Technology (JAIST)(日本先进科学研究院) College of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程学院)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

AI总结 本文提出一种基于视觉提示的统一推送策略,通过整合轻量级提示机制提升多模态推送动作的生成效率,适用于广泛规划问题,并在桌面清洁任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 57%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16455 2026-02-19 cs.CV 57%

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

视觉自校准:一种像素引导的准确图表解析范式

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII) Shanghai Innovation Institute(上海创新研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 57%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 57%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.LG

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21205 2026-02-13 cs.CV cs.CL 57%

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

TABLET:一个大规模数据集,用于鲁棒的视觉表格理解

Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 TABLET是一个大规模视觉表格理解数据集,包含400万个示例和21项任务,旨在提升模型对真实世界表格可视化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11156 2026-02-13 cs.CL cs.AI cs.IR 57%

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

HybridRAG: 一种基于预生成问答的LLM聊天机器人框架

Sungmoon Kim, Hyuna Jeon, Dahye Kim, Mingyu Kim, Dong-Kyu Chae, Jiwoong Kim

机构 * Hanyang University(翰阳大学) Makebot Inc.(Makebot公司)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 HybridRAG通过预生成问答库和实时生成相结合,提升聊天机器人在处理无结构文档时的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05384 2026-02-06 cs.CV 57%

Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting

Dolphin-v2:通过可扩展的锚点提示实现通用文档解析

Hao Feng, Wei Shi, Ke Zhang, Xiang Fei, Lei Liao, Dingkang Yang, Yongkun Du, Xuecheng Wu, Jingqun Tang, Yang Liu, Hong Chen, Can Huang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 Dolphin-v2通过可扩展的锚点提示实现通用文档解析,改进了文档类型分类、布局分析和元素检测,提升了对拍摄文档的解析能力并减少错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV 57%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20552 2026-01-29 cs.CV 57%

DeepSeek-OCR 2: Visual Causal Flow

DeepSeek-OCR 2: 视觉因果流

Haoran Wei, Yaofeng Sun, Yukun Li

机构 * DeepSeek-AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 DeepSeek-OCR 2通过两个级联的一维因果推理结构实现二维图像理解,提升视觉处理的语义连贯性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02729 2026-01-26 cs.CL cs.AI cs.IR 57%

Unified Multimodal Interleaved Document Representation for Retrieval

统一多模态交错文档表示用于检索

Jaewoo Lee, Joonho Ko, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) KAIST(韩国科学技术院) DeepAuto

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06404 2026-01-19 cs.CV 57%

InfoAffect: Affective Annotations of Infographics in Information Spread

InfoAffect: 信息传播中信息图的情感标注

Zihang Fu, Yunchao Wang, Chenyu Huang, Guodao Sun, Ronghua Liang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 InfoAffect数据集通过多模态大语言模型和递归排名融合算法,实现了信息图情感标注的高准确度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 57%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 57%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03993 2026-01-08 cs.CV 57%

PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography

PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体

Junle Liu, Peirong Zhang, Yuyi Zhang, Pengyu Yan, Hui Zhou, Xinyue Zhou, Fengjun Guo, Lianwen Jin

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02384 2026-01-07 cs.CV 57%

RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成

Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Peking University(北京大学) South China Normal University(华南师范大学) Northwestern Polytechnical University(西北工业大学)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02660 2026-01-05 cs.CV cs.IR 57%

Spatially-Grounded Document Retrieval via Patch-to-Region Relevance Propagation

通过补丁到区域相关性传播实现空间感知的文档检索

Athos Georgiou

机构 * Independent Researcher(独立研究者)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 通过结合ColPali的补丁相似性与OCR区域,实现更精确的文档检索,提升RAG任务中的上下文相关性

Comments 21 pages, 6 figures, 8 tables. Includes ancillary files with full benchmark results and ablation studies. Code available at https://github.com/athrael-soju/Snappy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20479 2025-12-24 cs.CV 57%

UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images

UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成

Yiming Zhao, Yuanpeng Gao, Yuxuan Luo, Jiwei Duan, Shisong Lin, Longfei Xiong, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。

Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20174 2025-12-24 cs.CV cs.CL cs.IR 57%

Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark

迈向基于自然语言的文档图像检索:新数据集和基准

Hao Guo, Xugong Qin, Jun Jie Ou Yang, Peng Zhang, Gangyan Zeng, Yubo Li, Hailun Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学 cyber 科学与工程学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Southern California(美国南加州大学) Laboratory for Advanced Computing and Intelligence Engineering(先进计算与智能工程实验室)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于自然语言的文档图像检索基准,通过生成细粒度语义查询提升检索性能,推动视觉文档理解领域研究。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 57%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2025-12-01 cs.CV 57%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12307 2025-11-27 cs.CV cs.CL 57%

LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?

LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?

Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

AI总结 LogicOCR通过构建包含生成和现实图像问题的基准测试,评估大型多模态模型在文本丰富图像上的逻辑推理能力,并提出TextCue方法提升模型对关键文本区域的感知。

Comments GitHub: https://github.com/MiliLab/LogicOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12978 2025-11-18 cs.CV 57%

Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad(IIIT海得拉尔计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru(Adobe研究)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments 25 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11552 2025-11-17 cs.CV cs.CL 57%

DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding

Dawei Zhu, Rui Meng, Jiefeng Chen, Sujian Li, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏