Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) ; IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。