PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
PaddleOCR-VL-1.5:迈向一个鲁棒的多任务0.9B视觉语言模型用于野外文档解析
机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)
专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV
AI总结 PaddleOCR-VL-1.5通过引入Real5-OmniDocBench基准测试,在文档解析任务中达到94.5%的SOTA准确率,并扩展了密封识别和文本定位任务,同时保持0.9B超紧凑模型的高效性。