SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models
用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐
机构 * University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Huazhong University of Science and Technology(华中科技大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Infiforce(英飞拓)
AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。
Comments 8 pages, 4 figures