Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
进化式越狱:针对大语言模型的自动化多目标长尾攻击
机构 * School of Artificial Intelligence(人工智能学院) ; Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Southern University of Science and Technology(南方科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。