Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观
Jiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue, Zhixuan Chu, Xiting Wang
机构
*
Alibaba Group(阿里巴巴集团)
;
The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
;
Renmin University of China(中国人民大学)