G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models
G$^3$VLA:视觉-语言-动作模型的几何归纳偏置
机构 * New York University Shanghai(上海纽约大学) ; Technical University of Denmark(丹麦技术大学) ; MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI
AI总结 提出G$^3$VLA模块,通过射线嵌入、投影位置编码和跨视图融合为VLA模型注入相机几何先验,无需深度传感器,在多个基准和真实机器人上提升空间敏感任务性能。
Comments Submitted to CoRL 2026