Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观
Jiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue, Zhixuan Chu, Xiting Wang
机构
*
Alibaba Group(阿里巴巴集团)
;
The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
;
Renmin University of China(中国人民大学)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
;
Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
Microsoft Research(微软研究院)
;
University of Michigan(密歇根大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
CUHKSZ(香港中文大学(深圳))
;
THU(清华大学)
Vision-Language Feature Alignment for Road Anomaly Segmentation
视觉-语言特征对齐用于道路异常分割
Zhuolin He, Jiacheng Tang, Jian Pu, Xiangyang Xue
机构
*
School of Computer Science, Fudan University(复旦大学计算机科学学院)
;
Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)