Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出
机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) ; Zhejiang University(浙江大学) ; Guangzhou University(广州大学) ; Chongqing University(重庆大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。