Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
先caption,后VQA:知识密度而非任务格式驱动多模态扩展
机构 * vivo AI Lab(vivo人工智能实验室) ; Wuhan University(武汉大学)
AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。
Comments 23 pages, 4 figures, 10 tables. Preprint