Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型
机构 * Kyoto University(京都大学) ; NII LLMC(国立信息学研究所LLMC) ; Waseda University(早稻田大学) ; Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; Aichi Institute of Technology(爱知工业大学) ; Institute of Physical and Chemical Research(理化学研究所)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。
Comments Accepted to COLM 2026