Automating Deception: Scalable Multi-Turn LLM Jailbreaks
自动化欺骗:可扩展的多轮LLM欺骗攻击
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(埃弗格林谷学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。