Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐
机构 * Brown University(布朗大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.CL
AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。
Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026