UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling
UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Xiaomi EV(小米汽车)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO
AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。