LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航
机构 * University of Science and Technology of China(中国科学技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Stanford University(斯坦福大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。
Comments Project page:https://abdd.top/latentpilot/