CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
CoLA: 跨模态低秩适配用于多模态下游任务
机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) ; University of Surrey(塞维利亚大学) ; Surrey Institute for People-Centred AI(以人为本的人工智能研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL
AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。
Comments Accepted by ICML 2026, 17 pages, 6 Figures