TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding
TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%
Comments 10 pages, 5 figures, 7 tables