UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型
机构 * University of Twente(特温特大学) ; Xiaomi EV(小米汽车) ; University of Cambridge(剑桥大学) ; University of Bath(巴斯大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。
Comments 18 pages, 7 figures, 8 tables