MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
MAGIC: 面向视觉语言模型的多模态对齐与接地感知指令核心集
机构 * Purdue University(普渡大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);LLaVA(abstract,abstract_cn)
AI总结 提出MAGIC方法,利用预训练VLM中的多模态增益、桥接相关性和技能神经元签名三种内在信号,通过无训练、前向传播的核心集选择,构建紧凑且行为保真的子集用于多模态指令微调,在20%预算下达到甚至超越全微调性能。