GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
GesVLA: 一种具有手势感知能力的视觉-语言-动作模型嵌入表示
机构 * Tsinghua University(清华大学) ; Dexmal
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出GesVLA模型,通过引入手势作为平行指令模态,解决现有VLA系统在复杂场景中空间模糊问题,采用双VLM架构实现手势表示与动作策略的紧密耦合,并通过手势数据生成管道和两阶段训练策略提升目标定位准确性和人机交互效率。
Comments Project page: https://gwxuan.github.io/GesVLA/