Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
通过语言引导的语义线索实现对遮挡和小物体的鲁棒接地
机构 * Integrated Vision Language Lab.(集成视觉语言实验室)
专题命中 其他多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出通过语言引导的语义线索提升MLLM在拥挤场景中的接地能力,通过语义线索提取器和文本嵌入引导优化对象语义,实验表明能有效提高接地精度。
Comments 4 pages, 2 figures, ICASSP 2026