AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Harvard University, US(哈佛大学,美国)
专题命中 端到端驾驶 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.RO、cs.CV
AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。