arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2406.02884 2024-11-27 cs.CV 57%

PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM

Tao Yang, Yingmin Luo, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments 13 pages; with PosterGen as extension; IEEE template

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01523 2024-11-13 cs.CV cs.CL 57%

MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations

Yubo Ma, Yuhang Zang, Liangyu Chen, Meiqi Chen, Yizhu Jiao, Xinze Li, Xinyuan Lu, Ziyu Liu, Yan Ma, Xiaoyi Dong, Pan Zhang, Liangming Pan, Yu-Gang Jiang, Jiaqi Wang, Yixin Cao, Aixin Sun

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05254 2024-11-11 cs.CV 57%

Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding

Jaeyoo Park, Jin Young Choi, Jeonghyung Park, Bohyung Han

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13824 2024-11-07 cs.CV cs.CL 57%

Harnessing Webpage UIs for Text-Rich Visual Understanding

Junpeng Liu, Tianyue Ou, Yifan Song, Yuxiao Qu, Wai Lam, Chenyan Xiong, Wenhu Chen, Graham Neubig, Xiang Yue

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05121 2024-11-05 cs.AI cs.CL 57%

Large Language Model for Table Processing: A Survey

Weizheng Lu, Jing Zhang, Ju Fan, Zihao Fu, Yueguo Chen, Xiaoyong Du

专题命中 文档图表理解 :visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11965 2024-10-23 cs.CV 57%

UrbanWorld: An Urban World Model for 3D City Generation

Yu Shang, Yuming Lin, Yu Zheng, Hangyu Fan, Jingtao Ding, Jie Feng, Jiansheng Chen, Li Tian, Yong Li

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11500 2024-09-19 cs.CL cs.AI 57%

Multi-Document Grounded Multi-Turn Synthetic Dialog Generation

Young-Suk Lee, Chulaka Gunasekara, Danish Contractor, Ramón Fernandez Astudillo, Radu Florian

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11633 2024-09-12 cs.CV 57%

DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models

Renqiu Xia, Song Mao, Xiangchao Yan, Hongbin Zhou, Bo Zhang, Haoyang Peng, Jiahao Pi, Daocheng Fu, Wenjie Wu, Hancheng Ye, Shiyang Feng, Bin Wang, Chao Xu, Conghui He, Pinlong Cai, Min Dou, Botian Shi, Sheng Zhou, Yongwei Wang, Bin Wang, Junchi Yan, Fei Wu, Yu Qiao

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

Comments Homepage of DocGenome: https://unimodal4reasoning.github.io/DocGenome_page 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14213 2024-08-27 cs.CV cs.CL 57%

From Text to Pixel: Advancing Long-Context Understanding in MLLMs

Yujie Lu, Xiujun Li, Tsu-Jui Fu, Miguel Eckstein, William Yang Wang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14439 2024-07-22 cs.CV 57%

Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding

Renshan Zhang, Yibo Lyu, Rui Shao, Gongwei Chen, Weili Guan, Liqiang Nie

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02558 2024-07-15 cs.CL cs.CV 57%

The Minimum Information about CLinical Artificial Intelligence Checklist for Generative Modeling Research (MI-CLAIM-GEN)

Brenda Y. Miao, Irene Y. Chen, Christopher YK Williams, Jaysón Davidson, Augusto Garcia-Agundez, Shenghuan Sun, Travis Zack, Suchi Saria, Rima Arnaout, Giorgio Quer, Hossein J. Sadaei, Ali Torkamani, Brett Beaulieu-Jones, Bin Yu, Milena Gianfrancesco, Atul J. Butte, Beau Norgeot, Madhumita Sushil

专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06556 2024-06-12 cs.CL cs.AI 57%

Enhancing Presentation Slide Generation by LLMs with a Multi-Staged End-to-End Approach

Sambaran Bandyopadhyay, Himanshu Maheshwari, Anandhavelu Natarajan, Apoorv Saxena

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13478 2024-06-12 cs.IR cs.CL cs.CV cs.MM 57%

SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval

Siwei Wu, Yizhi Li, Kang Zhu, Ge Zhang, Yiming Liang, Kaijing Ma, Chenghao Xiao, Haoran Zhang, Bohao Yang, Wenhu Chen, Wenhao Huang, Noura Al Moubayed, Jie Fu, Chenghua Lin

专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV

Comments camera-ready version for ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08037 2024-05-15 cs.HC cs.AI 57%

Layout Generation Agents with Large Language Models

Yuichi Sasazawa, Yasuhiro Sogawa

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00260 2024-05-02 cs.CV 57%

CREPE: Coordinate-Aware End-to-End Document Parser

Yamato Okamoto, Youngmin Baek, Geewook Kim, Ryota Nakao, DongHyun Kim, Moon Bin Yim, Seunghyun Park, Bado Lee

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments Accepted at the International Conference on Document Analysis and Recognition (ICDAR 2024) main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09797 2024-04-16 cs.CV 57%

TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding

Bozhi Luan, Hao Feng, Hong Chen, Yonghui Wang, Wengang Zhou, Houqiang Li

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06918 2024-04-11 cs.CV 57%

HRVDA: High-Resolution Visual Document Assistant

Chaohu Liu, Kun Yin, Haoyu Cao, Xinghua Jiang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Linli Xu

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12895 2024-03-20 cs.CV 57%

mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding

Anwen Hu, Haiyang Xu, Jiabo Ye, Ming Yan, Liang Zhang, Bo Zhang, Chen Li, Ji Zhang, Qin Jin, Fei Huang, Jingren Zhou

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09675 2024-03-18 cs.CV cs.GR 57%

Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases

Rio Aguina-Kang, Maxim Gumin, Do Heon Han, Stewart Morris, Seung Jean Yoo, Aditya Ganeshan, R. Kenny Jones, Qiuhong Anna Wei, Kailiang Fu, Daniel Ritchie

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments See ancillary files for link to supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02384 2024-02-16 cs.CV 57%

ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning

Fanqing Meng, Wenqi Shao, Quanfeng Lu, Peng Gao, Kaipeng Zhang, Yu Qiao, Ping Luo

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

Comments Updated and corrected experimental results, removal of inappropriate experiments, and a more comprehensive experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06116 2024-02-12 cs.RO cs.AI 57%

LLMs for Coding and Robotics Education

Peng Shu, Huaqin Zhao, Hanqi Jiang, Yiwei Li, Shaochen Xu, Yi Pan, Zihao Wu, Zhengliang Liu, Guoyu Lu, Le Guan, Gong Chen, Xianqiao Wang Tianming Liu

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17107 2024-02-06 cs.CV cs.CL 57%

LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding

Yanzhe Zhang, Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Nedim Lipka, Diyi Yang, Tong Sun

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10188 2023-12-19 cs.LG 57%

WordScape: a Pipeline to extract multilingual, visually rich Documents with Layout Annotations from Web Crawl Data

Maurice Weber, Carlo Siebenschuh, Rory Butler, Anton Alexandrov, Valdemar Thanner, Georgios Tsolakis, Haris Jabbar, Ian Foster, Bo Li, Rick Stevens, Ce Zhang

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.LG

Comments NeurIPS 2023 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15808 2023-05-26 cs.CV 57%

Towards Language-guided Interactive 3D Generation: LLMs as Layout Interpreter with Generative Feedback

Yiqi Lin, Hao Wu, Ruichen Wang, Haonan Lu, Xiaodong Lin, Hui Xiong, Lin Wang

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

Comments Preprint. Work in Progres

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02223 2022-10-06 cs.CL cs.AI 57%

CorefDiffs: Co-referential and Differential Knowledge Flow in Document Grounded Conversations

Lin Xu, Qixian Zhou, Jinlan Fu, Min-Yen Kan, See-Kiong Ng

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13979 2022-08-01 cs.CL cs.AI 57%

Knowing Where and What: Unified Word Block Pretraining for Document Understanding

Song Tao, Zijian Wang, Tiantian Fan, Canjie Luo, Can Huang

专题命中 文档图表理解 :MLLM(abstract);分类 cs.AI

Comments incomplete experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08387 2022-07-20 cs.CL cs.CV 57%

LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

Yupan Huang, Tengchao Lv, Lei Cui, Yutong Lu, Furu Wei

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07770 2022-04-19 cs.CL cs.AI 57%

UniGDD: A Unified Generative Framework for Goal-Oriented Document-Grounded Dialogue

Chang Gao, Wenxuan Zhang, Wai Lam

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02923 2021-11-09 cs.CV cs.CL 57%

StrucTexT: Structured Text Understanding with Multi-Modal Transformers

Yulin Li, Yuxi Qian, Yuchen Yu, Xiameng Qin, Chengquan Zhang, Yan Liu, Kun Yao, Junyu Han, Jingtuo Liu, Errui Ding

专题命中 文档图表理解 :visual language model(abstract);分类 cs.CV

Comments ACM Multimedia 2021. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00711 2021-10-05 cs.CV 57%

Asking questions on handwritten document collections

Minesh Mathew, Lluis Gomez, Dimosthenis Karatzas, CV Jawahar

专题命中 文档图表理解 :visual question answering(abstract);分类 cs.CV

Comments pre-print version

Journal ref journal = {Int. J. Document Anal. Recognit.}, volume = {24}, number = {3}, pages = {235--249}, year = {2021}

详情

展开后加载摘要…

URL PDF HTML 收藏