Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
评估稀疏自编码器与概念标注的可解释性
机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) ; Technische Universität Berlin(柏林工业大学) ; INRAE(法国国家农业、食品与环境研究院) ; Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) ; UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。
Comments Accepted at ECCV 2026