Selective Safety Steering via Value-Filtered Decoding
基于价值过滤解码的选择性安全引导
机构 * Department of Electrical and Computer Engineering, Technion IIT(技术学院电气与计算机工程系) ; Department of Statistics, University of Oxford(牛津大学统计系) ; OATML, Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Computer Science, Technion IIT(技术学院计算机科学系)
AI总结 本文提出一种测试时引导方法,通过价值基的安全标准过滤token,减少不必要的干预,提升不安全响应的安全性,同时在多个数据集上验证了其在安全与帮助性之间的更好平衡。