Detecting Safety Violations Across Many Agent Traces
在大量智能体轨迹中检测安全违规
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。
Comments 35 pages, 17 figures