VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy, Beijing, China(中关村学院) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Eastern Institute of Technology, Ningbo(宁波东部科技研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nankai University(南开大学)
专题命中 机器人基础模型 :world model(title);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。