3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验
机构 * Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Daimon Robotics(达梦机器人) ; Great Bay University(大亚大学)
AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。