Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
通过现实场景合成和文档感知训练实现真实世界文档解析
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Tencent(腾讯) ; Nankai University(南开大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 文档图表理解 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。