Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
通过粗到细的视觉处理提升文档解析效率和性能
机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队) ; Xi’an Jiaotong University(西安交通大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PaddleOCR-VL模型,通过粗到细的视觉处理方法,减少冗余视觉区域,提升文档解析和识别的效率与性能,实验表明其在页面级和元素级识别上均达到最优。
Comments Accepted by CVPR2026