Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
通过内部归因图对大语言模型越狱进行机制性可解释性研究
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。