LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior
LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习
机构 * Southeast University(东南大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。
Comments Accepted to ECCV2026