Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
多级安全连续投影:无需重新训练的微调大语言模型安全增强方法
机构 * Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知人工智能实验室,中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Long-term AI(长期人工智能)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种无需重新训练的微调后安全增强方法MSCP,通过多级表示对齐和安全方向投影,有效抑制有害输出并提升与人类偏好的对齐度。