arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-19 至 2026-08-19 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2608.17205 2026-08-19 cs.CL cs.CV 新提交 79%

Which Source Wins? Task-Dependent Reliance in Vision-Language Models

哪个来源更胜一筹?视觉-语言模型中依赖关系的任务依赖性

Rodela Ghosh, Aviral Gupta, Guangjing Wang

机构 * University of South Florida(南佛罗里达大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究探究视觉-语言模型的模态依赖,通过构建算术与图表冲突基准,发现其依赖关系随任务、证据结构等变化,不同模型在对应基准中呈现相反的模态依赖模式。

Comments 20 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-19 cs.CV cs.AI 版本更新 79%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, MingKun Jiang, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17550 2026-08-19 cs.CV cs.CL 新提交 57%

Code as Representation: A Compilable Parsing Paradigm for Academic Documents

代码作为表示:学术文档的可编译解析范式

Rihui Jin, Jun Wang, chengyuan zhu, Liang Mingyu, Yue Gao, Li Yunxuan, Kuicai Dong, Guilin Qi, Lin Ren, Yongrui Chen, Xinbang Dai, Jiaqi Li, Tongtong Wu, Gholamreza Haffari

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏