An Embarrassingly Simple Detector for Model Extraction Attacks in Large Language Model API Traffic
一种用于大型语言模型API流量中模型提取攻击的极其简单的检测器
机构 * Santa Clara University(圣克拉拉大学) ; Florida State University(佛罗里达州立大学)
专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出一种基于最大均值差异(MMD)的简单检测方法,通过将查询嵌入语义空间并比较其与历史良性流量的分布差异,有效检测LLM API中的模型提取攻击。
Comments Preprint. Code available at https://github.com/LabRAI/mmd-llm-mea-detection