MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。