No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
无单一失效神经元:针对白盒攻击的分布式安全对齐
机构 * The University of Sydney(悉尼大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。