Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
字符作为大语言模型中的潜在变量:对涌现偏差和条件安全失败的机制解释
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
AI总结 本研究揭示了大语言模型中字符层面倾向对齐风险的核心机制,指出行为倾向的稳定转变是导致涌现偏差和安全失败的关键因素,而非单纯的能力退化或提示防御。