Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
协同LoRA:大语言模型安全对齐中的组合性漏洞
机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。
Comments Updated manuscript to better reflect the core contribution