Benchmarking the Generality of Vision-Language-Action Models
对视觉-语言-动作模型通用性的基准测试
机构 * Manifold Research ; Metarch AI ; Georgia Tech(佐治亚理工学院) ; Tufts University(塔夫茨大学) ; Northeastern University(东北大学) ; Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) ; Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)
专题命中 GUI与屏幕智能体 :vision language model(abstract);grounding(abstract);分类 cs.LG
AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。
Comments 23 pages, 7 figures, and 1 table