Mechanisms of Object Localization in Vision-Language Models
视觉-语言模型中物体定位的机制
机构 * Goethe University Frankfurt, Germany(法兰克福歌德大学,德国) ; The Hessian Center for AI, Germany(黑森人工智能中心,德国)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);InternVL(summary_cn,abstract);vision-language model(title);grounding(abstract)
AI总结 本文研究了视觉-语言模型中物体定位的核心机制,通过分析LLaVA-1.5和InternVL-3.5等模型,揭示了定位依赖于容器化机制,并发现只有少量注意力头参与分类和定位任务,为未来模型设计提供了指导。
Comments Accepted at CVPR 2026