JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding
JaWildText:面向日文场景文本理解的视觉-语言模型基准测试
机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) ; Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。
Comments 18 pages