One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection
一次越狱,多种语言:学习语言无关的意图表示用于多语言越狱检测
机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) ; School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对多语言LLM安全漏洞,提出MLJailDe框架,通过多语言回译数据增强和相对距离约束,实现跨语言越狱检测,F1达98.5%。