StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
StereoVLA:利用立体视觉增强视觉-语言-动作模型
机构 * Galbot ; CFCS, School of CS, Peking University(北京大学计算机学院CFCS) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The University of Hong Kong(香港大学) ; Xiamen University Malaysia(厦门大学马来西亚分校) ; Southern University of Science and Technology(南方科技大学)
AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。