Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙
机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) ; Waseda University(早稻田大学)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。