OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation
OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; National Taiwan University(国立台湾大学) ; Wuhan University(武汉大学) ; Wuhan University of Technology(武汉理工大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
专题命中 BEV与占用 :BEV(summary_cn,abstract);autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。
Comments 24 pages, 10 figures