PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection
PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统
机构 * Fudan University(复旦大学)
专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI
AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。