Improving Safety Alignment via Balanced Direct Preference Optimization
通过平衡直接偏好优化提升安全性对齐
机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);DPO(abstract)
AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。