Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning
解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示
机构 * Tsinghua University(清华大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; National University of Singapore(新加坡国立大学)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。