Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models
Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法
机构 * Nanjing University(南京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。