Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。