Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
思考、行动、构建:一种基于视觉语言模型的代理框架用于零样本3D视觉定位
机构 * University of California, Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);vision-language model(abstract);VLM(abstract)
AI总结 本文提出TAB框架,通过2D到3D重建范式直接处理原始RGB-D流,利用2D VLMs解析复杂空间语义并结合多视图几何构建3D结构,克服传统方法依赖预处理点云的局限,实验证明其在ScanRefer和Nr3D上优于零样本方法和全监督基线。