SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses
知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估
机构 * University of Connecticut(康涅狄格大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Independent(独立研究者)
专题命中 安全评测 :jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。