PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡
机构 * PaddlePaddle Team(PaddlePaddle团队) ; Baidu Inc(百度公司)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。