WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型
机构 * Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学)
专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。
Comments 20 pages, 7 figures