Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics
基于DMD的提示-响应嵌入动态分类实现大语言模型安全
机构 * University of Tennessee(田纳西大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文将幻觉检测的动力系统框架扩展到LLM安全分类,通过拟合安全与不安全状态的Koopman模型,利用差分残差评分分类不安全输出,在多基准测试中验证了纳入提示嵌入的改进效果。