Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
人格攻击:针对大型语言模型的增量记忆注入越狱攻击
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);prompt injection(abstract)
AI总结 提出一种基于记忆注入的越狱方法Persona Attack,通过逐步操纵模型上下文窗口,使模型在记忆积累中优先处理注入指令,从而绕过安全对齐,在特定配置下攻击成功率可达95%。