SafeSeek: Universal Attribution of Safety Circuits in Language Models
SafeSeek: 语言模型中安全回路的通用归因
机构 * University of Science ; United Arab Emirates University ; Nanyang Technological University ; Zayed University ; Intelligent Science \& Technology Academy of CASIC
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SafeSeek框架,通过优化识别语言模型中的完整安全回路,验证了在后门攻击和安全对齐场景中的有效性,展示了安全回路的识别与利用方法。