arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-20 至 2026-08-20 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2608.18289 2026-08-20 cs.AI cs.CR cs.IR cs.LG 新提交 85%

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

在高风险公共部门应用中使用开源模型评估结构化信息提取

Elias Schubert, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对欧盟AI法案高风险公共部门应用场景,构建基准评估开源OCR、LLM、VLM在学生申请处理任务的性能,发现零样本下多数模型表现差,输入结构保留是关键因素。

Comments Accepted at Workshop on Systems Over Models: What Actually Works in Industry (SOMI-2026) at ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 79%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 文档图表理解 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18685 2026-08-20 cs.CV 新提交 57%

DocClaw: A Unified Agentic System for Intelligent Document Processing

DocClaw:用于智能文档处理的统一智能体系统

Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV

AI总结 研究针对现有智能文档处理任务多为独立建模的问题,提出统一智能体系统DocClaw,通过智能体与文档的共享交互处理多种IDP任务,在基准测试中取得有竞争力的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏