SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习
机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) ; Motional, USA(Motional公司) ; Northeastern University, USA(东北大学)
AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。
Comments Project page: https://spanvla.github.io/