Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders
通过稀疏自编码器提取和分析视觉语言模型中的多模态概念
机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)
专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);visual question answering(abstract)
AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。
Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua