arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-10 至 2026-04-10 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 数据集与评测 1 篇

2604.07973 2026-04-10 cs.AI 70%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏