Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding
为什么我们看那里:一种最大化场景理解的视网膜视觉语言模型表现出的人类样注视模式
机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加州大学圣芭芭拉分校心理学与脑科学系) ; Electrical and Computer Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校电气与计算机工程系) ; Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)
专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI
AI总结 研究探讨了人类自由观看时注视模式的形成机制,发现最大化场景理解的视网膜视觉语言模型能够产生类似人类的注视模式,表明这种模式可能是优化场景理解的副产品。