From Scene to Object: Text-Guided Dual-Gaze Prediction
从场景到物体:文本引导的双目预测
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) ; Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。