Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
基于感知增强的视觉-语言模型的物体指称引导的注视路径预测
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV
AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。
Comments ICMR 2026