Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
对齐反噬:在16种语言的LLM多智能体系统中语言依赖性的安全干预逆转
机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪精神病研究所以及性犯罪医疗中心) ; Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究发现,在不同语言的LLM多智能体系统中,对齐干预可能导致安全措施的逆转,揭示了语言空间对对齐效果的决定性影响。
Comments 89 pages, 4 figures, 4 supplementary figures, 12 supplementary tables; preprint