MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Kingsoft Office(金山办公软件)
AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。