To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调
机构 * School of Computing ; Augmented Intelligence, Arizona State University, Tempe, AZ, USA ; Department of Computer Science ; Engineering, Texas A\&M University, College Station, TX, USA
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。