arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3433 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3433 篇

2312.08984 2024-02-02 cs.CV cs.MM 86%

CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer

Yabing Wang, Fan Wang, Jianfeng Dong, Hao Luo

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13631 2023-10-24 cs.CL cs.CV cs.IR 86%

EDIS: Entity-Driven Image Search over Multimodal Web Content

Siqi Liu, Weixi Feng, Tsu-jui Fu, Wenhu Chen, William Yang Wang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00424 2023-06-02 cs.CL cs.CV cs.IR 86%

End-to-end Knowledge Retrieval with Multi-modal Queries

Man Luo, Zhiyuan Fang, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09868 2022-04-22 cs.CV cs.MM 86%

Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval

Zhiqiang Yuan, Wenkai Zhang, Kun Fu, Xuan Li, Chubo Deng, Hongqi Wang, Xian Sun

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

Journal ref in IEEE Transactions on Geoscience and Remote Sensing, vol. 60, pp. 1-19, 2022, Art no. 4404119

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.05125 2021-09-14 cs.IR cs.AI cs.CL cs.LG 86%

MURAL: Multimodal, Multitask Retrieval Across Languages

Aashi Jain, Mandy Guo, Krishna Srinivasan, Ting Chen, Sneha Kudugunta, Chao Jia, Yinfei Yang, Jason Baldridge

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14082 2021-06-29 cs.CV cs.AI 86%

Generalized Zero-Shot Learning using Multimodal Variational Auto-Encoder with Semantic Concepts

Nihar Bendre, Kevin Desai, Peyman Najafirad

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.13868 2021-06-08 cs.CL cs.CV cs.IR 86%

Learning Relation Alignment for Calibrated Cross-modal Retrieval

Shuhuai Ren, Junyang Lin, Guangxiang Zhao, Rui Men, An Yang, Jingren Zhou, Xu Sun, Hongxia Yang

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted by ACL-IJCNLP 2021 main conference (Long Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.08784 2021-04-13 cs.CL cs.CV 86%

LightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval

Siqi Sun, Yen-Chun Chen, Linjie Li, Shuohang Wang, Yuwei Fang, Jingjing Liu

专题命中 跨模态检索 :image-text(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.08617 2020-09-24 cs.CV cs.CL cs.IR cs.LG 86%

Preserving Semantic Neighborhoods for Robust Cross-modal Retrieval

Christopher Thomas, Adriana Kovashka

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

Journal ref ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13360 2025-03-31 cs.CV cs.AI cs.CL cs.LG cs.MM 86%

RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models

Haoran Hao, Jiaming Han, Changsheng Li, Yu-Feng Li, Xiangyu Yue

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by CVPR 2025. Code: https://github.com/Hoar012/RAP-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03127 2023-02-07 cs.CL cs.AI cs.CV cs.MM 86%

Logically at Factify 2: A Multi-Modal Fact Checking System Based on Evidence Retrieval techniques and Transformer Encoder Architecture

Pim Jordi Verschuuren, Jie Gao, Adelize van Eeden, Stylianos Oikonomou, Anil Bandhakavi

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI;multimodal(comments)

Comments Accepted in AAAI'23: Second Workshop on Multimodal Fact-Checking and Hate Speech Detection, February 2023, Washington, DC, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15094 2026-07-17 cs.CV cs.LG 新提交 85%

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

AlphaWiSE:用于连续多模态表示学习的自适应权重插值

Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究连续多模态表示学习中跨模态对齐被破坏的问题,提出AlphaWiSE方法,通过事后权重空间插值,由两个冻结源检查点拟合系数实现插值检查点,在多模态检索实验中相比基线有持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 85%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05275 2026-07-02 cs.CV 版本更新 85%

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs

Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入

Qi Li, Yanzhe Zhao, Yongxin Zhou, Yameng Wang, Yandong Yang, Yuanjia Zhou, Jinxiang Liu

机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新 85%

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 跨模态检索 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28845 2026-06-30 cs.CV 85%

Personalizing MLLMs via Reinforced Multimodal Reference Game

通过强化多模态参考游戏个性化多模态大语言模型

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。

Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29602 2026-05-29 cs.CV 85%

CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

CogniVerse: 用认知反思与几何推理革新多模态检索增强生成

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CogniVerse框架,通过认知反思模块、基于黎曼流形对齐的多模态检索模块和最优传输层次生成模块,解决多模态检索增强生成中的噪声检索、跨模态语义错位和生成不连贯问题。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26941 2026-05-27 cs.IR cs.MM 85%

The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval

第二届EReL@MIR研讨会:面向多模态信息检索的高效表示学习

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Xi Wang, Qijiong Liu, Qian Li, Joemon M. Jose

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.MM

AI总结 本研讨会旨在探讨多模态基础模型在信息检索中的效率瓶颈,并提出通过组织学术与工业界交流,推动高效表示学习的新方法、度量标准和基准。

Comments Accepted as a workshop proposal at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10016 2026-05-25 cs.CL 85%

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 85%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR 85%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16427 2026-04-20 cs.CV 85%

Cross-modal learning for plankton recognition

跨模态学习用于浮游生物识别

Joona Kareinen, Veikka Immonen, Tuomas Eerola, Lumi Haraguchi, Lasse Lensu, Kaisa Kraft, Sanna Suikkanen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉佩宁拉-拉赫蒂技术大学) Finnish Environment Institute(芬兰环境研究所) Faculty of Information Technology(信息科技学院) Brno University of Technology(布拉格技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出利用自监督跨模态协调策略,结合大量未标记浮游生物数据,构建多模态识别模型。通过图像与光学测量数据共同指导学习,无需人工标注,提升识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14044 2026-04-16 cs.CV 85%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 85%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR 85%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 85%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV 85%

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20916 2025-12-25 cs.IR cs.MM 85%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.MM

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 85%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10552 2025-11-14 cs.CL 85%

URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding

Yongxin Shi, Jiapeng Wang, Zeyu Shan, Dezhi Peng, Zening Lin, Lianwen Jin

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏