MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation
MMLoP: 多模态低秩提示用于高效视觉-语言适配
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。