G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models
G$^3$VLA:视觉-语言-动作模型的几何归纳偏置
机构 * New York University Shanghai(上海纽约大学) ; Technical University of Denmark(丹麦技术大学) ; MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校)
AI总结 提出G$^3$VLA模块,通过射线嵌入、投影位置编码和跨视图融合为VLA模型注入相机几何先验,无需深度传感器,在多个基准和真实机器人上提升空间敏感任务性能。
Comments Submitted to CoRL 2026