Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
先caption,后VQA:知识密度而非任务格式驱动多模态扩展
机构 * vivo AI Lab(vivo人工智能实验室) ; Wuhan University(武汉大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。
Comments 23 pages, 4 figures, 10 tables. Preprint