Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
通过与劫持相关的表示转移理解并防御VLM劫持
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究VLM在视觉模态整合后安全对齐减弱的问题,发现劫持样本在表示空间中形成独特状态,提出通过移除劫持相关转移提升安全性。