mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索
机构 * KAIST(韩国科学技术院) ; POSTECH
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。
Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol