NeST: Neuron Selective Tuning for LLM Safety
NeST: 面向LLM安全的神经元选择性调优
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG
AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。