Attention Alignment Between Humans and Vision-Language Models
人类与视觉语言模型之间的注意力对齐
Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano
机构
*
Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所)
;
Department of Psychology, Princeton University(普林斯顿大学心理学系)
;
Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
;
Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心)
;
Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
AI总结
本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。