How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Northeastern University(东北大学) ; National University of Defense Technology(国防科技大学) ; Shandong University(山东大学) ; BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.AI
AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。