arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-10 至 2026-07-10 共收录 1 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 自动驾驶 1 篇

2607.08375 2026-07-10 cs.CV cs.AI 新提交 71%

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏