Understanding the Effects of Safety Unalignment on Large Language Models
理解安全对齐偏差对大语言模型的影响
机构 * Leidos(Leidos公司)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。
Comments 12 pages, 2 figures, 5 tables