Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models
面向视觉-语言-动作模型的来自解析概念的显式运动学引导
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Westlake University(西湖大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。