Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
响应攻击:利用上下文优先级来劫持大语言模型
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
AI总结 响应攻击通过利用对话中中间响应作为上下文优先级,有效劫持大语言模型生成违反政策的内容。
Comments 20 pages, 10 figures. Code and data available at https://github.com/Dtc7w3PQ/Response-Attack