SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性
机构 * LG AI Research(LG人工智能研究)
专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。
Comments 40 pages
Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026