Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐
机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) ; National University of Singapore(新加坡国立大学)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。