PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance
PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型
机构 * CASIA(中国科学院自动化研究所) ; TARS Robotics(TARS机器人实验室) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; National University of Singapore(新加坡国立大学) ; Tongji University(同济大学)
AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。