Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding
超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解
机构 * The University of Hong Kong(香港大学)
专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV
AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。