Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
通过现实场景合成和文档感知训练实现真实世界文档解析
Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Tencent(腾讯)
;
Nankai University(南开大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Nanjing University of Science and Technology(南京理工大学)
专题命中
文档图表理解
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性
Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen
机构
*
Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所)
;
Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
文档图表理解
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构
*
AIML, University of Adelaide(AIML,阿德莱德大学)
;
Monash University(墨尔本大学)
;
Australian National University(澳大利亚国立大学)
;
Tiktok, Australia(Tiktok,澳大利亚)
;
Zhejiang University(浙江大学)
专题命中
文档图表理解
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG
机构
*
Shandong Second Medical University(山东第二医科大学)
;
Shandong University(山东大学)
;
Bairong Inc.(百融云创科技股份有限公司)
;
Ke Holdings Inc.(贝壳控股有限公司)
;
School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院)
;
Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)
专题命中
文档图表理解
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding
HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速
Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin
机构
*
South China University of Technology(华南理工大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院)
;
Nanjing University(南京大学)
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
PRISM-XR: 通过多模态大语言模型赋能隐私感知的扩展现实协作
Jiangong Chen, Mingyu Zhu, Bin Li
机构
*
Department of Electrical Engineering, The Pennsylvania State University, University Park, PA 16802, USA(电气工程系,宾夕法尼亚州立大学,University Park,PA 16802,USA)
专题命中
文档图表理解
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion
Ahmed Nassar, Andres Marafioti, Matteo Omenetti, Maksym Lysak, Nikolaos Livathinos, Christoph Auer, Lucas Morin, Rafael Teixeira de Lima, Yusik Kim, A. Said Gurbuz, Michele Dolfi, Miquel Farré, Peter W. J. Staar
专题命中
文档图表理解
:vision-language model(title,abstract);vision language model(abstract);分类 cs.CV