arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2101.11272 2021-05-11 cs.CL cs.CV 57%

VisualMRC: Machine Reading Comprehension on Document Images

Ryota Tanaka, Kyosuke Nishida, Sen Yoshida

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments Accepted as a full paper at AAAI 2021. The first two authors have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08405 2021-04-20 cs.CL cs.CV cs.IR 57%

LAMPRET: Layout-Aware Multimodal PreTraining for Document Understanding

Te-Lin Wu, Cheng Li, Mingyang Zhang, Tao Chen, Spurthi Amba Hombaiah, Michael Bendersky

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00398 2021-01-06 cs.CV cs.IR 57%

DocVQA: A Dataset for VQA on Document Images

Minesh Mathew, Dimosthenis Karatzas, C. V. Jawahar

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments accepted at WACV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11644 2026-08-14 cs.DB 版本更新 50%

Guided Table Retrieval for Structured Data Search

面向结构化数据搜索的引导式表格检索

Alekh Jindal, Jyoti Pandey, Christina Pavlopoulou, Ronith PR, Sharath Prakash, Shi Qiao, Shivani Tripathi, Wangda Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 50%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 文档图表理解 :vision language model(abstract)

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28853 2026-08-03 cs.HC 新提交 50%

Spatial Visual Analytics for Multi-Document Summary Verification

面向多文档摘要验证的空间视觉分析技术

Jiahao Xu, Wei Liu, Yang Liu, Eric Krokos, Kirsten Whitley, Xuan Wang, Rebecca Faust, Chris North

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对多文档摘要验证难题,提出SVS视觉分析系统,含两种二维布局,实验表明其可提升验证准确性、降低工作量,SUMMARY-GUIDED布局综合表现最优。

Comments Accepted to IEEE VIS 2026; 13 pages, including appendices (11-page paper plus 2-page appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16134 2026-08-03 cs.DB 版本更新 50%

Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents

对异构科学提取文档中表格提取的基准测试

Marijan Soric, Cécile Gracianne, Ioana Manolescu, Pierre Senellart

专题命中 文档图表理解 :vision language model(abstract)

AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。

Comments Extended version, with appendices, of a paper published at KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 50%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 文档图表理解 :grounding(abstract)

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24895 2026-06-25 cs.DL 新提交 50%

Hybrid Metadata Extraction from League of Nations Index Cards: From Feasibility Study to Archival System Integration

国联索引卡片的混合元数据提取:从可行性研究到档案系统集成

Florian Cafiero, Grégoire Mallard

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26615 2026-06-08 cs.CL 版本更新 50%

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

SlideAgent:用于多页视觉文档理解的分层代理框架

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。

Comments ACL 2026 Main Conference. https://slideagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29476 2026-05-29 cs.CL 50%

Comparative Evaluation of Machine Translation Systems on Images with Text

含文本图像的机器翻译系统比较评估

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)

专题命中 文档图表理解 :MLLM(abstract_cn)

AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25781 2026-05-26 cs.CL 50%

Double Triangle Annotation: A Scalable Human-in-the-Loop Framework for High-Precision Historical Document Annotation

双三角形标注:一种可扩展的人机协同高精度历史文档标注框架

Yi Ren

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 提出双三角形标注框架,通过两层人机协同和跨模型共识自动完成大部分标注工作,实现高精度历史文档结构化信息提取。

Comments 12 pages, 4 figures. ACL ARR 2026 March submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15794 2026-05-18 cs.CL 50%

ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation

ForMaT:用于视觉接地多语言PDF翻译的数据集

Michał Ciesiółka, Dawid Wiśniewski, Adrian Charkiewicz, Kamil Guttmann

机构 * Laniqo Faculty of Mathematics and Computer Science, Adam Mickiewicz University(亚当·密茨凯维奇大学数学与计算机科学学院) Poznań University of Technology(波兹南技术大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 ForMaT通过3956个PDF构建多语言翻译数据集,保留布局元数据以提升多模态翻译效果,采用K-Medoids采样捕捉复杂元素,揭示当前MT系统在空间接地与几何同步上的不足,为布局感知翻译模型提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 50%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10855 2026-05-12 cs.CL 50%

Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding

从少量数据中学习更多:利用反事实以提高图表理解的数据效率

Jianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Aumovio Singapore Pte. Ltd.(Aumovio新加坡私人有限公司)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出ChartCF框架,通过反事实数据合成和多模态偏好优化,提升图表理解的反事实敏感性,实验表明其在少数据下表现优异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22051 2026-04-28 cs.HC 50%

DataSway: Vivifying Metaphoric Visualization with Animation Clip Generation and Coordination

DataSway: 通过动画片段生成与协调使隐喻可视化生动化

Liwenhan Xie, Jiayi Zhou, Anyi Rao, Huamin Qu, Xinhuan Shu

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出DataSway系统,通过动画片段生成与协调技术,帮助用户创建基于SVG的隐喻可视化动画,提升数据抽象编码的理解与交互体验。

Comments Accepted to DIS'26: ACM Designing Interactive Systems. Website: https://shellywhen.github.io/projects/DataSway

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17325 2026-04-21 cs.CL 50%

Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation

对齐文档与问题:面向问题的文档重写以增强检索增强生成

Jiaang Li, Zhendong Mao, Quan Wang, Yuning Wan, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 本文提出QREAM框架,通过风格控制重写使检索文档更符合问题需求,提升检索增强生成的准确性与效率。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 50%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05038 2026-04-08 cs.CL 50%

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

引导查询细化:多模态混合检索与测试时优化

Omri Uzan, Asaf Yehudai, Roi pony, Eyal Shnarch, Ariel Gera

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03992 2026-04-02 cs.IR 50%

Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval

Nemotron ColEmbed V2:视觉文档检索中表现优异的后期交互嵌入模型

Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu, Oliver Holworthy, Benedikt Schifferer, Zhiding Yu, Yauhen Babakhin, Radek Osmulski, Jiarui Cai, Ryan Chesler, Bo Liu, Even Oldridge

专题命中 文档图表理解 :VLM(abstract)

AI总结 本文提出Nemotron ColEmbed V2模型,通过集群采样、硬负样本挖掘等技术,在ViDoRe基准上实现最佳性能,展示了低维嵌入在准确率与存储间的平衡实验。

Comments Proceedings of the 1st Late Interaction Workshop (LIR) @ ECIR 2026, April 02, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL 50%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 50%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 文档图表理解 :LLaVA(abstract)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 50%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 文档图表理解 :grounding(abstract)

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10891 2026-03-13 cs.HC 50%

(De)composing Craft: An Elementary Grammar for Sharing Expertise in Craft Workflows

(解)构工艺:一种用于在工艺流程中分享专业知识的初级语法

Ritik Batra, Lydia Kim, Ilan Mandel, Amritansh Kwatra, Jane L. E, Steven J. Jackson, Thijs Roumen

专题命中 文档图表理解 :MLLM(abstract)

AI总结 本文提出一种初级语法,用于记录工艺实践中的即兴行动,通过CraftLink界面分析视频并生成文档,促进知识共享与协作档案建设。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 50%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 文档图表理解 :MLLM(abstract)

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13059 2026-02-16 cs.CL 50%

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

TraceBack: 多智能体分解用于细粒度表格归因

Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究院)

专题命中 文档图表理解 :grounding(abstract)

AI总结 TraceBack通过多智能体框架实现细粒度表格归因,提供可验证的单元格支持证据,提升问题回答的透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10271 2026-02-16 cs.IR cs.CL 50%

MLDocRAG: Multimodal Long-Context Document Retrieval Augmented Generation

MLDocRAG: 多模态长上下文文档检索增强生成

Yongyue Zhang, Yaxiong Wu

机构 * Independent Researcher(独立研究者)

专题命中 文档图表理解 :grounding(abstract)

AI总结 MLDocRAG通过构建多模态片段-查询图,实现多模态长上下文文档的检索增强生成,提升问答的准确性和连贯性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19712 2026-01-28 cs.SD cs.MM 50%

Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling

具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成

Congyi Fan, Jian Guan, Youtian Lin, Dongli Xu, Tong Ye, Qiaoxi Zhu, Pengming Feng, Wenwu Wang

机构 * Group of Intelligent Signal Processing(智能信号处理组) Harbin Engineering University(哈尔滨工程大学) School of Intelligence Science and Technology(智能科学与技术学院) Nanjing University(南京大学) Processing Speech and Images(语音与图像处理) KU Leuven(库尔勒文大学) Acoustics Lab(声学实验室) University of Technology Sydney(悉尼技术大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) University of Surrey(萨里大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。

Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09554 2025-12-17 cs.IR 50%

Mixture-of-RAG: Integrating Text and Tables with Large Language Models

混合RAG:利用大语言模型整合文本和表格

Chi Zhang, Qiyang Chen, Mengqi Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。

Comments Accepted to SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 50%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏