ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models
ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型
机构 * University of Maryland, College Park ; University of Wisconsin, Madison ; City University of Hong Kong ; St.\ Paul's School
专题命中 空间理解 :3D vision(abstract);spatial understanding(abstract);分类 cs.CV
AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。