The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding
图像与文本学习的极限:视觉语言模型与具身场景理解
机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) ; Colgate University(科尔盖特大学)
AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。
Comments 7 figures, 5 tables