Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution
解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配
机构 * Tsinghua University(清华大学) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。