Grounded 3D-Aware Spatial Vision-Language Modeling
基于三维感知的空间视觉语言建模
机构 * UCSD(加州大学圣迭戈分校) ; MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。
Comments CVPR 2026 https://www.anjiecheng.me/gr3d