PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
机构 * PaddlePaddle Team, Baidu Inc.(百度公司)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * PaddlePaddle Team, Baidu Inc.(百度公司)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.AI
Comments Code and qualitative examples are available at: https://psrdataset.github.io
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Gianforte School of Computing(吉安福特计算学院) ; Montana State University Bozeman(蒙大拿州立大学博兹曼分校)
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
机构 * NVIDIA(英伟达)
专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 4 figures, AIED 2025
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments WWW'25
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 7 figures
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Project webpage: https://m3docrag.github.io
专题命中 文档图表理解 :visual language model(abstract);分类 cs.AI、cs.LG
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments CVPR 2024
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.LG
Comments 18 pages, accepted as a reproducibility paper at ECIR 2023
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments ACM MM 2022
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to Findings of EMNLP 2022
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted by 1st DialDoc Workshop at ACL-IJCNLP 2021
超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露
机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) ; Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) ; Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。
Comments ACM mm 2026
DATAREEL:基于动画的自动化数据驱动视频故事生成
机构 * York University(约克大学) ; Bangladesh University of Business and Technology(孟加拉国商业与技术大学) ; RBC, Canada(加拿大RBC) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。
Comments Under Review
ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。
OCR评估方法和指标及历史文件的不可见性综述
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 本文探讨OCR系统在历史文档中的评估问题,指出现代文档评估方法忽视了历史档案的布局、字体和材料退化,导致结构性不可见和代表性伤害。
Comments This manuscript is the author's submitted version to the ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026). Please cite the final published version via ACM Digital Library when available
Journal ref FAccT '26: The 2026 ACM Conference on Fairness, Accountability, and Transparency
Roomer:用于3D室内布局合成的基于对象的反射式模型编辑与修复
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 针对现有室内布局生成器的局部违规问题,提出Roomer框架,通过视觉语言模型规划器与确定性求解器实现基于对象的局部修复,提升布局物理有效性与可用性且可跨生成器迁移。
将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。
基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型
机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) ; Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) ; Zhejiang University(浙江大学) ; Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) ; Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) ; Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI
AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。