Involuntary In-Context Learning: Exploiting Few-Shot Pattern Completion to Bypass Safety Alignment in GPT-5.4
强制性上下文学习:利用少样本模式完成来绕过GPT-5.4的安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract)
AI总结 本文提出了一种称为强制性上下文学习(IICL)的攻击方法,通过使用少量示例的抽象操作符框架来强制模式完成,从而绕过大型语言模型的安全对齐训练。通过在10个OpenAI模型上进行3479次测试,研究发现语义操作符命名可以实现100%的绕过率,抽象框架是攻击的关键,而示例顺序和温度参数对攻击效果有显著影响。