Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
思考、行动、构建:一种基于视觉语言模型的代理框架用于零样本3D视觉定位
机构 * University of California, Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 三维重建 :3D reconstruction(abstract);point cloud(abstract);分类 cs.CV
AI总结 本文提出TAB框架,通过2D到3D重建范式直接处理原始RGB-D流,利用2D VLMs解析复杂空间语义并结合多视图几何构建3D结构,克服传统方法依赖预处理点云的局限,实验证明其在ScanRefer和Nr3D上优于零样本方法和全监督基线。