SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding
SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索
机构 * The University of Electro-Communications(电通大学)
专题命中 跨模态检索 :MLLM(title,title_cn);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。
Comments 20 pages, 6 figures