From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。