Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
深度安全攻击:从深度安全注意力头中劫持大语言模型
专题命中 越狱攻击 :jailbreak(title,abstract);safety(title);alignment(abstract);分类 cs.AI
AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
深度安全攻击:从深度安全注意力头中劫持大语言模型
专题命中 越狱攻击 :jailbreak(title,abstract);safety(title);alignment(abstract);分类 cs.AI
AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
RECAP:通过代理流水线从LLM训练中重现受版权保护的数据
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) ; Hydrox AI
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。