What Images Cannot Say: Language-Guided Olfactory Representation Learning
图像无法表达的:语言引导的嗅觉表征学习
机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。
Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/