Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans
匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比
机构 * F-initiatives(F计划) ; Université Sorbonne Paris Nord(巴黎北索邦大学) ; Northwestern University(西北大学) ; IULM university(IULM大学)
专题命中 视频多模态 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。
Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp