Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs
双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Stony Brook University(石溪大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。