HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型
机构 * Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Xi’an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO、cs.AI
AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。