Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges
对齐以错位:基于元优化LLM评判者的自动LLM劫持
机构 * Yonsei University(延世大学) ; Microsoft Research(微软研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出AMIS框架,通过双层结构联合优化劫持提示和评分模板,提升LLM劫持效果,实测在AdvBench和JBB-Behaviors上取得最佳性能。
Comments ICLR 2026