The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
对齐的艺术:细调方法如何有效地对齐和重新对齐训练后的LLM
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Flexera ; CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL
AI总结 研究探讨细调方法在对齐和重新对齐LLM中的效果,揭示攻击与防御间的机制不对称,发现ORPO在对齐方面最有效,DPO在重新对齐中表现优异但牺牲了模型实用性,同时发现模型特定的抗性及多轮对抗动态的残留效应。
Comments Accepted by ACL Findings 2026