arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-14 至 2026-08-14 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 5 篇

2608.12518 2026-08-14 cs.SE 新提交 90%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-14 cs.CV cs.AI 新提交 79%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 73%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12911 2026-08-14 cs.CV cs.CR cs.MM 新提交 57%

Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露

Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。

Comments ACM mm 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11644 2026-08-14 cs.DB 版本更新 50%

Guided Table Retrieval for Structured Data Search

面向结构化数据搜索的引导式表格检索

Alekh Jindal, Jyoti Pandey, Christina Pavlopoulou, Ronith PR, Sharath Prakash, Shi Qiao, Shivani Tripathi, Wangda Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。

详情

展开后加载摘要…

URL PDF HTML 收藏