PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
Comments 13 pages; with PosterGen as extension; IEEE template
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
Comments 13 pages; with PosterGen as extension; IEEE template
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track (Spotlight)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2024
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
专题命中 文档图表理解 :visual language model(abstract);分类 cs.AI
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV
Comments 14 pages
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV
Comments Homepage of DocGenome: https://unimodal4reasoning.github.io/DocGenome_page 22 pages, 11 figures
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV
专题命中 文档图表理解 :VLM(abstract);分类 cs.AI
专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV
Comments camera-ready version for ACL 2024 Findings
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments Accepted at the International Conference on Document Analysis and Recognition (ICDAR 2024) main conference
专题命中 文档图表理解 :grounding(abstract);分类 cs.CV
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted to CVPR 2024 main conference
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments 21 pages, 15 figures
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments See ancillary files for link to supplemental material
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
Comments Updated and corrected experimental results, removal of inappropriate experiments, and a more comprehensive experimental setup
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
Comments 20 pages, 6 figures, 1 table
专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV
Comments Preprint
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.LG
Comments NeurIPS 2023 Datasets and Benchmarks
专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV
Comments Preprint. Work in Progres
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI
专题命中 文档图表理解 :MLLM(abstract);分类 cs.AI
Comments incomplete experiments
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments ACM Multimedia 2022
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI
Comments ACL 2022
专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV
Comments ACM Multimedia 2021. 9 pages
专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV
Comments pre-print version
Journal ref journal = {Int. J. Document Anal. Recognit.}, volume = {24}, number = {3}, pages = {235--249}, year = {2021}