Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection
超越安全数据:具有正则安全反射的预训练阶段对齐
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。