TFL: Targeted Bit-Flip Attack on Large Language Model
TFL:针对大语言模型的定向位翻转攻击
机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) ; Arizona State University(亚利桑那州立大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
AI总结 TFL是一种新型定向位翻转攻击框架,通过精确操控LLM输出并减少对无关输入的影响,提升攻击的隐蔽性和针对性。
Comments 13 pages, 11 figures. Preprint