MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding
机构 * Ketong Chen, Yuhao Chen, Yang Xue(作者)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Ketong Chen, Yuhao Chen, Yang Xue(作者)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * Nankai University(南开大学) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * AI Research(360人工智能研究院)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
机构 * IRIT, University of Toulouse, France(IRIT,图卢兹大学,法国) ; Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息通信研究所(I2R),A*STAR,新加坡) ; CNRS, IRIT, France(CNRS,IRIT,法国)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * BAAI(北京人工智能研究院)
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI
Comments 10 pages
机构 * LTIMindTree
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV
Comments Accepted in NeurIPS 2025
机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室) ; Central South University(中南大学) ; Microsoft(微软公司)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments Project page: this https://linyq17.github.io/VC2L/
机构 * Tsinghua University(清华大学) ; Newcastle University(新castle大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments 58 pages
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
机构 * Kyushu University(九州大学) ; CyberAgent
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Xiamen Huaxia University(厦门华夏大学) ; Fuzhou University(福州市大学) ; City University of Hong Kong(香港城市大学) ; Huawei Cloud BU(华为云业务单元)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * DaVInCi Laboratory(DaVInCi实验室) ; University of Cincinnati(克利夫兰大学)
专题命中 文档图表理解 :VLM(abstract);分类 cs.AI
Journal ref The 2nd MERCADO Workshop at IEEE VIS 2025: Multimodal Experiences for Remote Communication Around Data Online, IEEE VIS 2025
专题命中 文档图表理解 :vision language model(abstract);分类 cs.LG
Comments EMNLP 2025
机构 * Opus AI Research(Opus人工智能研究机构) ; Brown University(布朗大学) ; Zhejiang University(浙江大学) ; University of Toronto(多伦多大学)
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
Comments working in progress
机构 * The Chinese University of Hong Kong(香港中文大学) ; Monash University(墨尔本大学) ; Amazon(亚马逊) ; South China University of Technology(华南理工大学)
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
机构 * Kling Team(Kling团队) ; PKU(北京大学) ; THU(清华大学) ; CASIA(中国科学院自动化研究所) ; CUHKSZ(香港科技大学) ; NTU(国立台湾大学) ; NJU(南京大学) ; XJTU(吉林大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025
机构 * The Hong Kong University of Science and Technology(香港理工大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments EMNLP 2025: Camera-ready version
机构 * Alibaba Group(阿里巴巴集团)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
机构 * University of Groningen(格罗宁根大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments ACMMM 2025
机构 * South China University of Technology(华南理工大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Maryland(马里兰大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments In submission. Project website: https://double-bench.github.io/
机构 * Meituan(美团)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI
机构 * Technical University of Darmstadt \& hessian.AI, Germany
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
Comments ICML 2025 version. 9 pages main paper, 35 pages with appendix, 18 figures and 7 tables. Corrected two inconsistent numbers in Table 2
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Nankai University(南开大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
机构 * Ant Group(蚂蚁集团) ; Southeast University(东南大学) ; Shanghai Jiao Tong University(上海交通大学) ; CUHK(香港中文大学) ; MBZUAI(墨尔本大学人工智能研究所)
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Zhongguancun Academy, Beijing(中关村学院,北京)
专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI
机构 * PaddlePaddle Team, Baidu Inc.(百度公司)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV