HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models
HyperSafe:微调语言模型推理时的安全恢复
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。