Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation
通过在线策略自我蒸馏减少大语言模型安全对齐的安全部署税
机构 * International Computer Science Institute(国际计算机科学研究所) ; Microsoft(微软) ; Berkeley Lab(伯克利实验室)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出了一种名为OPSA的在线策略自我蒸馏方法,通过引入教师翻转率指标,有效减少大语言模型在安全对齐过程中因分布不匹配导致的安全税,实验显示其在不同模型规模上均优于传统方法。
Comments 20 pages, 5 figures