3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models
3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块
机构 * HIT(哈尔滨工业大学) ; ZGCA(中钢集团自动化研究院) ; ZGCI(中钢集团信息研究院) ; HUST(华中科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ECNU(华东师范大学) ; DeepCybo
AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。
Comments 13 pages