OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶
机构 * ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; MEGVII Technology(美科维七科技) ; AFARI
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。