Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
通过选择性几何控制重新审视LLM安全对齐的鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; Hefei University of Technology(合肥工业大学) ; ST Engineering Ltd., Singapore(新加坡ST工程有限公司)
专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。