Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
视觉-语言模型将头部方向误认为注视方向:非语言对话线索
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; Emory University(埃默里大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; UC San Diego(圣地亚哥大学)
AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。
Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/