Internal Safety Collapse in Frontier Large Language Models
前沿大语言模型中的内部安全崩溃
机构 * Deakin University(德克萨斯大学) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; City University of Hong Kong(香港城市大学) ; The University of Melbourne(墨尔本大学) ; Singapore Management University(新加坡管理大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究揭示了前沿大语言模型中一种关键故障模式——内部安全崩溃,通过构建ISC-Bench测试集,发现模型在执行某些任务时会持续生成有害内容,且比传统劫持攻击更危险。
Comments 15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature