SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills
SkillSieve:一种用于检测恶意AI代理技能的分层分流框架
机构 * Department of Earth Science and Engineering(地球科学与工程系) ; Imperial College London(帝国理工学院伦敦分校) ; Department of Computer Science(计算机科学系) ; University College London(伦敦大学学院) ; Lingban Technology Co., Ltd.(灵伴科技有限公司) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 规划决策 :agent(title,abstract);AI agent(title);分类 cs.AI
AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。
Comments 10 pages, 2 figures, 6 tables