When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
当提示优化成为劫持:大型语言模型的自适应红队测试
机构 * Algoverse AI Research(Algoverse AI研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大型语言模型在对抗性提示优化下的安全性漏洞,通过自适应红队测试发现开源小模型的安全保障显著降低,表明静态评估无法准确反映真实风险。
Comments EACL SRW 2026, Oral