CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs
CSO-LLM:用于LLM训练后后门检测与触发器反转的类子空间正交化
机构 * Penn State University(宾夕法尼亚州立大学) ; Anomalee Inc.(Anomalee公司)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 提出CSO框架,通过类子空间正交化增强LLM后门检测的敏感性和特异性,并实现隐式黑名单功能,在连续和离散空间中均有效。