HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
HARP-VLA:面向视觉-语言-动作模型的人机对齐表示学习
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, China(清华大学交叉信息研究院) ; Shanghai Qi Zhi Institute, China(上海启智研究院)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO
AI总结 提出HARP框架,通过有限配对人机演示和未配对视频,学习对齐的人机视觉与潜在动作表示,提升VLA模型预训练效果,在CALVIN和真实世界任务中取得性能提升。