RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。