Private Direct Preference Optimization for LLM Alignment
面向大语言模型对齐的私有直接偏好优化
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract)
AI总结 该研究针对DPO的隐私缺陷,提出PrivDPO方法,通过沿偏好轴添加校准随机性实现偏好隐私,在对齐基准和LLM上取得了更好的隐私-效用权衡。
Comments accepted for publication at CCS 2026, extended version