Point What You Mean: Visually Grounded Instruction Policy
指出你的意图:基于视觉的指令策略
机构 * Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; Spirit AI ; Tsinghua University(清华大学)
专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV
AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。