OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型
机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) ; Omni AI(奥米尼人工智能) ; VBot ; East China Normal University(东华大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。