Diverse-Intent Multi-Turn Fashion Image Retrieval
多样化意图的多轮时尚图像检索
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
多样化意图的多轮时尚图像检索
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。
基于智能识别与生成的电子元件符号与引脚封装数据库
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; BTD Technology(BTD科技)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。
Comments Accepted by PRCV 2025
VizRAG:通过超图可视化增强检索增强生成
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Huawei Research(华为研究院) ; Beihang University(北京航空航天大学)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。