AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models
AEGIS:一种针对文本到图像模型中视觉同义词越狱的机制引导防御
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究所) ; Engineering Research Center of Cyber Security Auditing and Monitoring, Ministry of Education(教育部网络安全审计与监测工程研究中心)
专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 研究针对文本到图像模型中视觉同义词越狱问题,提出AEGIS防御机制,通过动态追踪不安全语义生成过程,利用稀疏语义注入注意力头,在推理时仅对易受攻击头部应用相似性感知排斥,提升了模型安全与效用。