HauntAttack: When Attack Follows Reasoning as a Shadow
HauntAttack:当攻击如影随形地跟随推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; StepFun ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)
AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。