arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-05 至 2026-08-05 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 5 篇

2608.00077 2026-08-05 cs.CV 版本更新 92%

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

超越准确率:针对OCR关键多模态大语言模型(MLLM)推理的视觉令牌剪枝空间溯源审计

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

专题命中 文档图表理解 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对OCR关键MLLM推理的视觉令牌剪枝,提出结合空间溯源的审计方法,发现准确率无法反映的质量风险,揭示模型特定前沿并验证压缩与任务通用性的关系,为视觉令牌剪枝评估提供新范式。

Comments 21 pages, including supplementary material. Code and reproducibility artifacts: https://github.com/SouthWinter/spatial-provenance-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03357 2026-08-05 cs.CV 新提交 81%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 74%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03464 2026-08-05 cs.AI cs.CL cs.HC 新提交 70%

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

ChartAnno:评估多模态大语言模型的图表标注生成能力

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25761 2026-08-05 cs.CV cs.DL 57%

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

OCR评估方法和指标及历史文件的不可见性综述

Fitsum Sileshi Beyene, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文探讨OCR系统在历史文档中的评估问题,指出现代文档评估方法忽视了历史档案的布局、字体和材料退化,导致结构性不可见和代表性伤害。

Comments This manuscript is the author's submitted version to the ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026). Please cite the final published version via ACM Digital Library when available

Journal ref FAccT '26: The 2026 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏