On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation
基于策略的一致性训练通过最小能力退化提升大语言模型安全性
机构 * New York University(纽约大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。