Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs
相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面
机构 * Appen(Appliance)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。