mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索
机构 * KAIST(韩国科学技术院) ; POSTECH
AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。
Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol