HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
HiVLA:一种以视觉为基础的分层具身操作系统
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。
Comments Project Page: https://tianshuoy.github.io/HiVLA-page/