Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs
级联稀疏自编码器在多模态大语言模型中学习多级视觉概念
机构 * Rutgers University(罗格斯大学) ; Microsoft Research(微软研究院)
专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出级联稀疏自编码器(CSAEs),通过在第一级SAE解码器权重上训练第二级SAE来学习层次化视觉概念,避免嵌套或堆叠SAE的缺点,在多个MLLM和数据集上提升了概念层次一致性和干预效果。