Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
安全并非普遍:大语言模型对齐中的选择性安全陷阱
机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) ; Federal University of Goiás(戈亚斯联邦大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。
Comments 22 pages