VEGAS: Human-Aligned Video Caption Evaluation via Gaze
VEGAS:通过注视进行与人类对齐的视频字幕评估
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; AMD(超威半导体公司)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。