AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。
Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv