A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
单个神经元足以绕过大型语言模型的安全对齐
机构 * Apple(苹果公司) ; University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过针对单个神经元展示安全对齐的两种失效方向,证明在不训练或提示工程的情况下,通过抑制或放大特定神经元可绕过安全对齐。