Curriculum Learning for Safety Alignment
用于安全对齐的课程学习
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Simons Institute, UC Berkeley(Simons研究所,伯克利大学)
专题命中 偏好对齐 :safety(title,abstract);DPO(summary_cn,abstract);alignment(title,abstract);jailbreak(abstract)
AI总结 提出基于课程学习的Staged-Competence框架,通过难度分级的偏好数据和渐进式参考模型更新,提升DPO安全对齐的鲁棒性,在三个模型族上平均降低16%的OOD有害响应率和20%的越狱攻击成功率。
Comments Accepted at the ICML 2026 GlobalSouthML Workshop