Probing Perceptual Constancy in Large Vision-Language Models
探测大型视觉-语言模型中的知觉恒常性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Emory University(埃默里大学) ; University of Washington(华盛顿大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了大型视觉-语言模型在颜色、大小和形状恒常性任务中的表现,发现模型在不同任务上的性能存在显著差异。
Comments Under Review