When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs
当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征
机构 * Google(谷歌公司) ; University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; Zhejiang University(浙江大学) ; Australian National University(澳大利亚国立大学)
AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。