M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models
M3DocDep: 多模态、多页、多文档依赖分块方法基于大视觉-语言模型
Joongmin Shin, Jeongbae Park, Jaehyung Seo, Heuiseok Lim
机构
*
Human-inspired AI Research, Korea University(韩国大学人智AI研究所)
;
Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系)
;
Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)
ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation
ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集
Enshuo Hsu, Jin Zhou, Kirk Roberts
机构
*
McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院)
;
Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)
专题命中
文档图表理解
:vision language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework
MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索
Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
UESTC
;
University of Virginia(弗吉尼亚大学)
;
HKUST(GZ)(香港科技大学(广州))
;
Cornell University(康奈尔大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
专题命中
文档图表理解
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解
Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris
机构
*
MIT(麻省理工学院)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
;
IBM Research(IBM研究院)
;
Abaka AI & 2077AI(Abaka AI及2077AI)
CommentsAccepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates