The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology
对抗影响的形状:利用持久同调表征大语言模型的潜在空间
机构 * Microsoft Security Response Center(微软安全响应中心) ; AIDOS Lab, University of Fribourg(弗里堡大学AIDOS实验室) ; Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系) ; Queen Mary University of London(伦敦大学量子玛丽学院) ; Imperial College London(伦敦帝国理工学院) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文利用持久同调方法分析对抗输入如何改变大语言模型潜在空间的几何拓扑结构,揭示了潜在空间压缩和拓扑特征的普遍性。