Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御
机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。
Comments CVPR 2026