OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
OCR 或不是?在 MLLMs 时代重新思考文档信息提取:基于真实世界的大规模数据集
机构 * SAP(SAP公司) ; Stanford University(斯坦福大学)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文探讨了在 MLLMs 时代是否仍需 OCR,通过大规模数据集评估发现,仅图像输入可达到与 OCR 增强方法相当的性能,并展示了通过精心设计的模式、示例和指示可进一步提升 MLLMs 的表现。