CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Comments Accepted by AAAI2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Comments Accepted by AAAI2024
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments EMNLP 2023 camera ready version
专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments ACL 2023
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Journal ref in IEEE Transactions on Geoscience and Remote Sensing, vol. 60, pp. 1-19, 2022, Art no. 4404119
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 5 pages, 2 figures, 2 tables
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted by ACL-IJCNLP 2021 main conference (Long Paper)
专题命中 跨模态检索 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments NAACL 2021
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Journal ref ECCV 2020
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by CVPR 2025. Code: https://github.com/Hoar012/RAP-MLLM
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments Accepted in AAAI'23: Second Workshop on Multimodal Fact-Checking and Hate Speech Detection, February 2023, Washington, DC, USA
AlphaWiSE:用于连续多模态表示学习的自适应权重插值
机构 * Google DeepMind(谷歌DeepMind)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 研究连续多模态表示学习中跨模态对齐被破坏的问题,提出AlphaWiSE方法,通过事后权重空间插值,由两个冻结源检查点拟合系数实现插值检查点,在多模态检索实验中相比基线有持续改进。
AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理
机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) ; School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。
Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入
机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。
Comments Accepted by ECCV 2026
病理学组合检索的组织病理学多模态嵌入
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 跨模态检索 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。
Comments Accepted by ECCV 2026
通过强化多模态参考游戏个性化多模态大语言模型
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。
Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html
CogniVerse: 用认知反思与几何推理革新多模态检索增强生成
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院)
专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出CogniVerse框架,通过认知反思模块、基于黎曼流形对齐的多模态检索模块和最优传输层次生成模块,解决多模态检索增强生成中的噪声检索、跨模态语义错位和生成不连贯问题。
Comments Accepted in CVPR 2026
第二届EReL@MIR研讨会:面向多模态信息检索的高效表示学习
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.MM
AI总结 本研讨会旨在探讨多模态基础模型在信息检索中的效率瓶颈,并提出通过组织学术与工业界交流,推动高效表示学习的新方法、度量标准和基准。
Comments Accepted as a workshop proposal at ACM Multimedia 2026
免训练的多模态大语言模型编排
机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) ; Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) ; School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) ; Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL
AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。
Journal ref ICML 2026
A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解
机构 * University of Amsterdam(阿姆斯特丹大学) ; University of Bristol(布里斯托大学) ; Amazon AGI(亚马逊人工智慧) ; College of Business and Economics(商学院和经济学学院) ; University of Johannesburg(约翰内斯堡大学)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。
Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval
压缩后再匹配:一种高效的多模态嵌入预训练范式
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kuaishou Technology(快手科技)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。
Comments ACL2026
跨模态学习用于浮游生物识别
机构 * Lappeenranta-Lahti University of Technology LUT(拉佩宁拉-拉赫蒂技术大学) ; Finnish Environment Institute(芬兰环境研究所) ; Faculty of Information Technology(信息科技学院) ; Brno University of Technology(布拉格技术大学)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出利用自监督跨模态协调策略,结合大量未标记浮游生物数据,构建多模态识别模型。通过图像与光学测量数据共同指导学习,无需人工标注,提升识别精度。
解读Delta:利用多模态大语言模型统一遥感变化检测与理解
机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) ; Space Engineering University(航天工程大学) ; Capital Normal University(首都师范大学)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。
MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索
机构 * Shandong University(山东大学)
专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。
Comments Accepted by The Web Conference 2026 (WWW2026)
超越全局相似性:面向细粒度、多条件多模态检索
机构 * Shanghai Jiao Tong University(上海交通大学) ; Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。
Comments Accepted by CVPR 2026
在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架
机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) ; Xiamen University, Media Analytics(厦门大学,媒体分析) ; Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。
Comments Equal contribution by Jie Li
分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现
机构 * Nanyang Technological University(南洋理工大学) ; Yale University(耶鲁大学) ; NYU Shanghai(纽约大学上海分校) ; Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Center for Data Science(数据科学中心) ; New York University(纽约大学)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。
MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.MM
AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。
Comments Under Review
突破模态壁垒:基于多模态大语言模型的通用嵌入学习
机构 * The University of Sydney(悉尼大学) ; DeepGlint ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Imperial College London(伦敦帝国理工学院)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。
Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CL
Comments Accepted by AAAI 2026 (Oral)