Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
用于大语言模型运行时恶意行为检测的分层收敛指纹
机构 * Singapore Management University(新加坡管理大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);prompt injection(abstract,abstract_cn);alignment(abstract);safety(abstract)
AI总结 本文提出LCF方法,通过分析神经网络层间隐藏状态轨迹来检测运行时恶意行为,无需参考模型或重训练,有效降低攻击成功率并高检测率识别多种威胁。
Comments 34 pages, 5 figures. Code: https://github.com/NayMyatMin/LCF-LLM