arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 655 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 655 篇

2605.27750 2026-05-28 cs.CL cs.AI cs.CV cs.DL 92%

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

阅读还是猜测?古希腊版本OCR中视觉语言模型的视觉定位失败

Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

机构 * Inria(法国国家信息与自动化研究所)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 通过对比开放权重视觉语言模型与传统OCR基线在低资源古希腊批判版本上的表现,发现VLM即使错误也能生成流畅文本,表明其依赖语言先验,并引入扰动和标记级定位度量分析视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00077 2026-08-05 cs.CV 版本更新 92%

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

超越准确率:针对OCR关键多模态大语言模型(MLLM)推理的视觉令牌剪枝空间溯源审计

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

专题命中 文档图表理解 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对OCR关键MLLM推理的视觉令牌剪枝,提出结合空间溯源的审计方法,发现准确率无法反映的质量风险,揭示模型特定前沿并验证压缩与任务通用性的关系,为视觉令牌剪枝评估提供新范式。

Comments 21 pages, including supplementary material. Code and reproducibility artifacts: https://github.com/SouthWinter/spatial-provenance-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09861 2026-04-22 cs.CV cs.AI 91%

A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends

基于MLLM的视觉丰富文档理解综述:方法、挑战与新兴趋势

Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun, Geoffrey Martin, Wei Liu, Yifan Peng

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Weill Cornell Medicine(韦尔·柯尔医学中心)

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于MLLM的视觉丰富文档理解最新进展,探讨了文本、视觉和布局特征的表示与整合技术,以及预训练、指令微调等训练方法,分析了数据稀缺、多页文档处理等挑战及新兴趋势。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10838 2026-08-12 cs.CV 新提交 91%

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

PolyLayout:超越矩形房间的分层VLM引导布局生成

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))

专题命中 文档图表理解 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 90%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31401 2026-06-02 cs.CL 89%

"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

Înţelegi Româneşte?'' 罗马尼亚语视觉语言模型的构建配方

Mihai Masala, Marius Leordeanu, Mihai Dascalu, Traian Rebedea

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学布加勒斯特国家大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 本文系统研究了构建罗马尼亚语视觉语言模型(VLM)的完整流程,通过翻译英文语料、消融实验分析视觉骨干、语言骨干和OCR数据的影响,并构建文化本地化评估集HoraVQA,证明罗马尼亚语适配模型在性能上超越同尺寸甚至更大尺寸的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10880 2026-08-04 cs.CV 版本更新 89%

Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation

图表规范:用于促进VLM在图表到代码生成中推理的结构表示

Minggui He, Mingchen Dai, Jian Zhang, Yilun Liu, Shimin Tao, Pufan Zeng, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University(早稻田大学) University of Science and Technology of China(中国科学技术大学) NanKai University(南开大学)

专题命中 文档图表理解 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00112 2026-06-02 cs.NE cs.CV 89%

Evolving to the Aesthetics of a Vision-Language Model

进化到视觉语言模型的美学

Stephen James Krol, Jon McCormack

机构 * SensiLab, Monash University Melbourne, Australia(传感实验室,墨尔本莫纳什大学,澳大利亚)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究探索使用视觉语言模型(VLM)通过CLIP-IQA评分或成对比较结合Glicko评级系统来评估进化设计的美学,并与艺术家排名对比分析两种方法的优劣。

Comments Paper presented at ICCC26, June 29 - July 3, 2026, Coimbra, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00161 2026-04-22 cs.CV 89%

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

Q-Mask:面向OCR的视觉语言模型中基于查询的因果遮罩用于文本锚定

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 本文提出Q-Mask框架,通过因果查询驱动的遮罩解码器提升OCR任务中文本锚定的准确性与稳定性,结合大规模标注数据集提升视觉语言模型对文本区域的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05261 2024-10-08 cs.CV cs.AI 88%

TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens

Ya-Qi Yu, Minghui Liao, Jiwen Zhang, Jihao Wu

专题命中 文档图表理解 :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27298 2026-05-27 cs.CL 88%

Self-Ensembling Vision-Language Models for Chart Data Extraction

用于图表数据提取的自集成视觉语言模型

Thomas Berkane, Qianyi Wang, Maimuna S. Majumder

机构 * Computational Health Informatics Program, Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院计算健康信息学项目及哈佛医学院)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 提出一种自集成方法,通过多次采样同一VLM的输出并聚合表格单元格,提升图表数据提取的准确性,并引入新基准WB-ChartExtract。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22774 2026-05-27 cs.CY cs.AI cs.CV cs.LG 88%

When VLMs 'Fix' Students: Identifying and Penalizing Over-Correction in the Evaluation of Multi-line Handwritten Math OCR

当VLM“修正”学生:多行手写数学OCR评估中的过度修正识别与惩罚

Jin Seong, Wencke Liermann, Minho Kim, Jong-hun Shin, Soojong Lim

机构 * Electronics and Telecommunications Research Institute(电子通信研究所)

专题命中 文档图表理解 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对多行手写数学OCR评估中VLM过度修正问题,提出基于LLM的语义评估指标PINK,有效惩罚过度修正,在FERMAT数据集上优于BLEU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01792 2026-08-04 cs.AI cs.CL 新提交 87%

Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

你能信任置信度吗?面向文档提取的视觉语言模型ConfBench

Priyashree Roy, Sujitha Martin, Mohammad Rostami, Spencer Romo, Renhao Xue, Bob Strahan, Diego A. Socolinsky, Boyi Xie, Md Mofijul Islam

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 87%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02025 2026-07-03 cs.CV 新提交 87%

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

评估视觉语言模型作为尼日利亚车牌识别的零样本学习替代方案:对比YOLO与光学字符识别

Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 研究探索视觉语言模型作为尼日利亚车牌识别的统一零样本解决方案,在88张真实图像上评估5种VLM,发现Gemini和Qwen在字符错误率上显著优于YOLO+OCR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 87%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23527 2026-05-25 cs.CE 87%

LiveFigure: Generating Editable Scientific Illustration with VLM Agents

LiveFigure: 利用VLM智能体生成可编辑的科学插图

Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

专题命中 文档图表理解 :VLM(title,title_cn)

AI总结 提出LiveFigure框架,通过VLM智能体模拟人类多步绘图流程,生成完全矢量化的可编辑科学插图,在17次手动编辑后达到80%的出版就绪率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29213 2026-06-30 cs.CL cs.CV 86%

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究

Aditya Pratap Singh

专题命中 文档图表理解 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。

Comments 9 pages, 5 figures. Benchmark and code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 86%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 文档图表理解 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20020 2026-05-27 cs.CV cs.AI 86%

Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR

分离跳跃链接与$R$-探针:解耦特征聚合与梯度传播用于MLLM OCR

Ziye Yuan, Ruchang Yao, Chengxin Zheng, Yusheng Zhao, Daxiang Dong, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,软件与硬件协同人工智能系统北京重点实验室,北京大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) Baidu Inc, Beijing, China(百度公司,北京,中国)

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在OCR任务中因梯度干扰导致细粒度视觉信息丢失的问题,提出分离跳跃链接(Detached Skip-Links)以解耦前向特征聚合与反向梯度传播,并引入$R$-探针($R$-Probe)诊断视觉令牌的可重构性,从而提升OCR及通用多模态任务性能。

Comments Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11101 2026-05-11 cs.CV cs.AI cs.MM 86%

Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR

共识熵:利用多视觉语言模型一致性的自验证和自改进OCR

Yulong Zhang, Tianyi Liang, Xinyue Huang, Erfei Cui, Guoqing Wang, Xu Guo, Chenhui Li, Gongshen Liu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Sun Yat-sen University(中山大学)

专题命中 文档图表理解 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出共识熵,一种无需训练的指标,通过测量多模型一致性熵来估计输出可靠性,开发了CE-OCR框架,通过多模型共识验证输出、选择最佳输出并提升效率,实验表明CE在质量验证中鲁棒,提升F1分数42.1%,优于自一致性及单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08746 2024-12-13 cs.CV cs.LG 86%

DocVLM: Make Your VLM an Efficient Reader

Mor Shpigel Nacson, Aviad Aberdam, Roy Ganz, Elad Ben Avraham, Alona Golts, Yair Kittenplon, Shai Mazor, Ron Litman

专题命中 文档图表理解 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18174 2025-09-26 cs.CV cs.CL 85%

Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR

Khalil Hennara, Muhammad Hreden, Mohamed Motasim Hamed, Ahmad Bastati, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 文档图表理解 :vision-language model(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24077 2026-07-28 cs.CV cs.LG eess.IV 新提交 85%

When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents

当低字符错误率还不够时:对乌拉圭历史文档视觉语言OCR系统中幻觉的分析

Marina Gardella, Camilo Mari{ñ}o, Diego Belzarena, Ignacio Ram{í}rez, Gregory Randall, Jean-Michel Morel

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究乌拉圭历史文档视觉语言OCR系统,在Berrutti数据集上对比传统OCR与VLM方法,发现VLM虽CER和WER优,但存在系统性失败模式,揭示了定量性能与转录保真度差距,强调需超越字符级准确性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 文档图表理解 :MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22918 2026-05-18 cs.CL 85%

Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models

视觉成为文本:在视觉-语言模型中定位OCR路由瓶颈

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL), University of Haifa(Swarms与AI实验室(SAIL),海法大学)

专题命中 文档图表理解 :vision-language model(title,abstract);InternVL(abstract,abstract_cn)

AI总结 研究揭示了视觉-语言模型中OCR信息进入语言处理流的瓶颈,通过因果干预分析三种架构,发现不同架构对场景文本和单阶段投影模型的敏感层不同,且PCA方向在不同数据集间可迁移,模块化OCR电路模型中移除OCR可提升计数性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13478 2025-11-18 cs.CV cs.AI cs.LG 85%

Semantic Document Derendering: SVG Reconstruction via Vision-Language Modeling

Adam Hazimeh, Ke Wang, Mark Collier, Gilles Baechler, Efi Kokiopoulou, Pascal Frossard

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05911 2026-08-07 cs.CV 新提交 84%

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press

绘制亚美尼亚巴黎:从20世纪侨民报刊中提取并地理编码商业广告

Chahan Vidal-Gorène, Seda Kirakosyan, Edita Matevosyan

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出基于IIIF的VLM驱动端到端流程,从西亚美尼亚语报刊中提取并地理编码商业广告,构建巴黎亚美尼亚商业社区交互式地图,相关成果可迁移至其他资源匮乏历史语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16872 2026-05-28 cs.CV 84%

DODO: Discrete OCR Diffusion Models

DODO: 离散OCR扩散模型

Sean Man, Gilad Deutch, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman

机构 * Technion - Israel Institute of Technology, Haifa, Israel.(特拉维夫大学-以色列理工学院,海法,以色列。) Amazon Web Services(亚马逊网络服务)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对OCR任务中自回归解码速度慢的问题,提出首个利用块离散扩散的VLM模型DODO,在保持高精度的同时实现高达5倍的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05820 2026-05-08 cs.CV 84%

ChartZero: Synthetic Priors Enable Zero Shot Chart Data Extraction

ChartZero:合成先验使零样本图表数据提取成为可能

Md Touhidul Islam, Yasir Mahmud, Sujan Kumar Saha, Mark Tehranipoor, Farimah Farahmandi

机构 * University of Florida(佛罗里达大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出ChartZero框架,通过合成先验实现鲁棒的零样本图表数据提取,克服了传统方法在曲线碎片化和语义关联上的缺陷,引入GOI损失和VLM引导的图例匹配策略,提升整体数据重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏