The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究
机构 * Tsinghua University(清华大学) ; ByteDance Seed(字节跳动种子)
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。