MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
MoDA: 面向指令型多模态大语言模型的细粒度视觉定位的调制适配器
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出MoDA调制适配器,通过指令引导的通道级乘法调制增强细粒度视觉定位,在12个基准上对三种MLLM架构取得一致提升,计算开销极小。
Comments Accepted at ICML 2026. Code is available at https://github.com/waybarrios/MoDA