DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment
DOG-DPO:几何中的动态优化用于安全对齐
机构 * University of Southern California(南加州大学) ; Iowa State University(爱荷华州立大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; UT Austin(德克萨斯大学奥斯汀分校) ; Independent Researcher(独立研究员) ; University of Notre Dame(圣母大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出DOG-DPO框架,将偏好对表示为模型表示空间中的方向,通过几何分解和多样性覆盖选择子集,仅用11%数据即可恢复大部分安全增益。