VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving
VLGA:用于自动驾驶的视觉-语言-几何-动作模型
机构 * Uber AV Labs(Uber自动驾驶实验室) ; University of Virginia(弗吉尼亚大学)
专题命中 仿真评测 :autonomous driving(title);LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV
AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。
Comments Project page: https://yaojin17.github.io/VLGA/