arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-28 至 2026-05-28 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 5 篇

2605.27750 2026-05-28 cs.CL cs.AI cs.CV cs.DL 92%

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

阅读还是猜测?古希腊版本OCR中视觉语言模型的视觉定位失败

Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

机构 * Inria(法国国家信息与自动化研究所)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 通过对比开放权重视觉语言模型与传统OCR基线在低资源古希腊批判版本上的表现,发现VLM即使错误也能生成流畅文本,表明其依赖语言先验,并引入扰动和标记级定位度量分析视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16872 2026-05-28 cs.CV 84%

DODO: Discrete OCR Diffusion Models

DODO: 离散OCR扩散模型

Sean Man, Gilad Deutch, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman

机构 * Technion - Israel Institute of Technology, Haifa, Israel.(特拉维夫大学-以色列理工学院,海法,以色列。) Amazon Web Services(亚马逊网络服务)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对OCR任务中自回归解码速度慢的问题,提出首个利用块离散扩散的VLM模型DODO,在保持高精度的同时实现高达5倍的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 73%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03491 2026-05-28 cs.CV cs.CL 70%

Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance

解耦骨架与血肉:基于解缠对齐和结构感知引导的高效多模态表格推理

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Xiaoqiang Zhou, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出DiSCo解缠结构-内容对齐框架和Table-GLS全局到局部结构引导推理框架,高效增强LVLM的表格理解与推理能力,无需昂贵监督或外部工具。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27978 2026-05-28 cs.CV 57%

ABot-OCR Technical Report

ABot-OCR 技术报告

Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng, Kangning Niu, Tianlun Li, Mu Xu

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 提出端到端视觉语言模型ABot-OCR,通过单次前向传播将页面图像直接转录为干净Markdown,并采用解耦异构文档优化的强化学习方法提升文本准确性和标记格式正确性,在OmniDocBench基准上达到最先进水平。

Comments 21 pages, 11 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏