Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性
机构 * University of Maryland College Park(马里兰大学学院市)
专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。