VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation
VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA
机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) ; Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO
AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。