JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
JEPA-WAM:基于联合嵌入世界建模的视觉-语言-动作策略学习
机构 * XYZ Embodied AI(XYZ具身智能)
专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO
AI总结 该研究提出JEPA-WAM,一种构建于预训练V-JEPA空间的隐式WAM,通过共享预测器耦合隐式转移预测与动作生成,在LIBERO-Plus等数据集上取得优异的机器人操作策略性能,且泛化能力强。
Comments 22 pages, 7 figures. Project page: https://spritewithoutice.github.io/JEPA_WAM/