Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
基于外部化攻击-防御共演的模型无关持续LLM安全
机构 * City University of Hong Kong(香港城市大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 越狱攻击 :safety(title,abstract);red teaming(abstract);分类 cs.CL
AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。
Comments 48 pages, 7 figures