Action with Visual Primitives
基于视觉基元的动作生成
机构 * Anyverse Dynamics ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。
Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/