GradShield: Alignment Preserving Finetuning
GradShield: 保持对齐的微调
机构 * University of California, Berkeley(加州大学伯克利分校) ; HUMAIN ; King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) ; University of Washington, Seattle(华盛顿大学(西雅图))
AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。