PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks
PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型
机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)
专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。