MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation
MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Microsoft Research Asia(微软亚洲研究院) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。