When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
基于嵌入的防御失效:重新思考基于大语言模型的多智能体系统的安全性
机构 * Rice University(稻属大学) ; University of Virginia(弗吉尼亚大学)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG
AI总结 研究探讨了基于嵌入的防御在多智能体系统中的失效模式,提出利用置信度信号提升系统鲁棒性,通过实验验证了早期干预的重要性。