Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models
旋转鲁棒性:一种对抗大语言模型位翻转攻击的无训练防御方法
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出旋转鲁棒性(RoR),通过正交Householder变换对激活空间进行旋转,有效消除激活异常值与敏感权重之间的对齐,提升大语言模型的可靠性。
Comments 13 pages, 8 figures. Preprint. Under review at IEEE Transactions on Information Forensics and Security