HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment
HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐
机构 * Tsinghua University(清华大学) ; Southeast University(东南大学) ; Microsoft(微软公司)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。