SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
SafeMERGE: 通过选择性层间模型融合在微调大语言模型中保持安全对齐
机构 * Technical University Munich(慕尼黑技术大学) ; IBM Research(IBM研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SafeMERGE,一种轻量级后微调框架,通过选择性融合层间模型来恢复安全对齐,同时保持下游性能,减少有害输出并提升实用性。
Journal ref Findings of the ACL 2026