Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观
机构 * Alibaba Group(阿里巴巴集团) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Renmin University of China(中国人民大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Safe-SAIL框架,通过稀疏自编码解释方法高效识别安全领域特征,减少解释成本55%,并系统评估1758个安全相关特征,揭示风险特征识别和安全关键实体编码机制。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18916-18935 (2026)