Latent Implicit Visual Reasoning
潜在隐式视觉推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Xero ; MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)
AI总结 本文提出了一种任务无关的机制,训练大规模多模态模型(LMMs)在无需显式中间监督的情况下发现和使用潜在视觉推理标记,从而在多种视觉中心任务中优于直接监督微调,并在不使用辅助图像、边界框、图像裁剪、深度图或思维链注释的情况下,与或优于先前基于文本和显式视觉中间推理方法相媲美。