LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; University of Toronto(多伦多大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 端到端驾驶 :end-to-end driving(title);autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。