MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
MoDA: 面向指令型多模态大语言模型的细粒度视觉定位的调制适配器
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出MoDA调制适配器,通过指令引导的通道级乘法调制增强细粒度视觉定位,在12个基准上对三种MLLM架构取得一致提升,计算开销极小。
Comments Accepted at ICML 2026. Code is available at https://github.com/waybarrios/MoDA