Multimodal Language Models Cannot Spot Spatial Inconsistencies
多模态语言模型无法发现空间不一致性
机构 * University of California, Davis(加州大学戴维斯分校) ; Shell(壳牌) ; TU Delft(代尔夫特理工大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。