Multilingual Safety Alignment Via Sparse Weight Editing
多语言安全对齐 via 稀疏权重编辑
机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.LG
AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。