Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
消除拒绝触发:理解并缓解安全对齐中的过度拒绝问题
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Michigan State University(密歇根州立大学) ; University of Mississippi(密苏里州立大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文研究了安全对齐中过度拒绝问题的成因,提出了一种考虑拒绝触发的缓解策略,通过优化训练过程提高模型对良性查询的响应能力。