arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-31 至 2026-07-31 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2603.19790 2026-07-31 cs.CV 版本更新 83%

Geometric Risk Control for Vision-Language Model OCR

从可信性到可验证性:具有视觉-语言模型的风险控制生成OCR

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) China University of Petroleum(中国石油大学) Southeast University(东南大学)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出通过几何风险控制器减少生成OCR的极端错误风险,利用结构化视图和轻量级筛查实现可靠部署。

Comments 9 pages, 5 figures, Code: https://github.com/phare111/GRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24973 2026-07-31 cs.CV cs.AI cs.CL 版本更新 73%

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

MinerU-Popo:结构化文档解析的通用后处理模型

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Fan Wu, Bin Wang, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of California, Berkeley(加州大学伯克利分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。

Comments The code is available at https://github.com/opendatalab/MinerU-Popo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28466 2026-07-31 cs.AI 新提交 57%

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型

Jia Yu, Yan Zhu, Yili He, Zilong Wang, Xinyang Jiang, Peiyao Fu, Ruijie Yang, Tianyi Chen, Siyuan Li, Zhihua Wang, Fei Wu, Quanlin Li, Xian Yang, Pinghong Zhou, Shuo Wang

机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。

详情

展开后加载摘要…

URL PDF HTML 收藏