Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment
难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐
机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) ; University of California, Merced, USA(加州大学默塞德分校,美国)
专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(title);分类 cs.AI
AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。
Comments Accepted to Findings of ACL 2026