DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力
机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。