arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3437 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3437 篇

2504.00954 2025-04-02 cs.CV cs.AI 84%

IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval

Bangwei Liu, Yicheng Bao, Shaohui Lin, Xuhong Wang, Xin Tan, Yingchun Wang, Yuan Xie, Chaochao Lu

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10604 2025-03-31 cs.CV cs.AI cs.LG 84%

Multi-modal Vision Pre-training for Medical Image Analysis

Shaohao Rui, Lingzhi Chen, Zhenyu Tang, Lilong Wang, Mianxin Liu, Shaoting Zhang, Xiaosong Wang

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Journal ref CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07610 2025-03-17 cs.LG cs.AI cs.CV cs.IR 84%

CSA: Data-efficient Mapping of Unimodal Features to Multimodal Features

Po-han Li, Sandeep P. Chinchali, Ufuk Topcu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Journal ref Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06380 2025-03-11 cs.CV cs.CL 84%

TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems

Khang H. N. Vo, Duc P. T. Nguyen, Thong Nguyen, Tho T. Quan

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04780 2025-03-10 cs.CL cs.AI physics.atom-ph 84%

MV-CLAM: Multi-View Molecular Interpretation with Cross-Modal Projection via Language Model

Sumin Ha, Jun Hyeong Kim, Yinhua Piao, Sun Kim

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12180 2025-02-19 eess.IV cs.AI cs.CV cs.LG 84%

ClusMFL: A Cluster-Enhanced Framework for Modality-Incomplete Multimodal Federated Learning in Brain Imaging Analysis

Xinpeng Wang, Rong Zhou, Han Xie, Xiaoying Tang, Lifang He, Carl Yang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21009 2025-02-11 cs.CV cs.IR cs.MM 84%

Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline

Nicola Messina, Lucia Vadicamo, Leo Maltese, Claudio Gennaro

专题命中 跨模态检索 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM

Comments Accepted as full paper at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05686 2025-01-13 cs.CV cs.MM 84%

Deep Reversible Consistency Learning for Cross-modal Retrieval

Ruitao Pu, Yang Qin, Dezhong Peng, Xiaomin Song, Huiming Zheng

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04173 2025-01-09 cs.CL cs.AI 84%

Multimodal Multihop Source Retrieval for Web Question Answering

Navya Yarrabelly, Saloni Mittal

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2010.03604 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03879 2025-01-08 cs.CV cs.AI 84%

CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds

Keonwoo Kim, Yeongjae Cho, Taebaek Hwang, Minsoo Jo, Sangdo Han

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01699 2025-01-06 cs.CV cs.MM 84%

Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels

Ruitao Pu, Yuan Sun, Yang Qin, Zhenwen Ren, Xiaomin Song, Huiming Zheng, Dezhong Peng

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

Comments 9 pages, AAAI 25 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19184 2024-12-30 cs.CV cs.CL 84%

Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching

Wenjing Chen

专题命中 跨模态检索 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13510 2024-12-19 cs.CV cs.CL 84%

Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval

Rui Cai, Zhiyu Dong, Jianfeng Dong, Xun Wang

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted by the 39th AAAI Conference on Artificial Intelligence (AAAI-25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10440 2024-12-17 cs.CV cs.AI 84%

Multi-level Matching Network for Multimodal Entity Linking

Zhiwei Hu, Víctor Gutiérrez-Basulto, Ru Li, Jeff Z. Pan

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19666 2024-12-02 eess.IV cs.AI cs.CV cs.LG stat.AP 84%

Multimodal Whole Slide Foundation Model for Pathology

Tong Ding, Sophia J. Wagner, Andrew H. Song, Richard J. Chen, Ming Y. Lu, Andrew Zhang, Anurag J. Vaidya, Guillaume Jaume, Muhammad Shaban, Ahrong Kim, Drew F. K. Williamson, Bowen Chen, Cristina Almagro-Perez, Paul Doucet, Sharifa Sahai, Chengkuan Chen, Daisuke Komura, Akihiro Kawabe, Shumpei Ishikawa, Georg Gerber, Tingying Peng, Long Phi Le, Faisal Mahmood

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments The code is accessible at https://github.com/mahmoodlab/TITAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17454 2024-11-27 cs.CV cs.CL 84%

FLEX-CLIP: Feature-Level GEneration Network Enhanced CLIP for X-shot Cross-modal Retrieval

Jingyou Xie, Jiayi Kuang, Zhenzhou Lin, Jiarui Ouyang, Zishuo Zhao, Ying Shen

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10513 2024-11-27 cs.CV cs.IR cs.MM 84%

Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction

Po-han Li, Yunhao Yang, Mohammad Omama, Sandeep Chinchali, Ufuk Topcu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15041 2024-11-25 cs.AI cs.CL 84%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16239 2024-10-24 cs.AI cs.CV cs.LG 84%

MoRE: Multi-Modal Contrastive Pre-training with Transformers on X-Rays, ECGs, and Diagnostic Report

Samrajya Thapa, Koushik Howlader, Subhankar Bhattacharjee, Wei le

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures, 9 tables. Supplementary detail in Appendix. Code made available in Github for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02182 2024-10-04 cs.CV cs.CR cs.LG cs.MM 84%

BadCM: Invisible Backdoor Attack Against Cross-Modal Learning

Zheng Zhang, Xu Yuan, Lei Zhu, Jingkuan Song, Liqiang Nie

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Image Processing, vol. 33, pp. 2558-2571, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10528 2024-09-18 cs.CV cs.AI 84%

From Latent to Engine Manifolds: Analyzing ImageBind's Multimodal Embedding Space

Andrew Hamara, Pablo Rivas

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments The 26th International Conference on Artificial Intelligence (ICAI'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09052 2024-09-17 eess.IV cs.AI cs.CV 84%

OrthoDoc: Multimodal Large Language Model for Assisting Diagnosis in Computed Tomography

Youzhu Jin, Yichen Zhang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07910 2024-08-16 cs.RO cs.CL cs.CV 84%

DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions

Ryosuke Korekata, Kanta Kaneda, Shunya Nagashima, Yuto Imai, Komei Sugiura

专题命中 跨模态检索 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16248 2024-08-06 cs.CV cs.MM 84%

Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval

Xiaowan Hu, Yiyi Chen, Yan Li, Minquan Wang, Haoqian Wang, Quan Chen, Han Li, Peng Jiang

专题命中 跨模态检索 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02867 2024-07-04 cs.MM cs.CL 84%

Contrast then Memorize: Semantic Neighbor Retrieval-Enhanced Inductive Multimodal Knowledge Graph Completion

Yu Zhao, Ying Zhang, Baohang Zhou, Xinying Qian, Kehui Song, Xiangrui Cai

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.MM

Comments Accepted by SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18254 2024-06-27 cs.IR cs.AI cs.MM 84%

Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning

Zhijie Nie, Richong Zhang, Zhangchi Feng, Hailang Huang, Xudong Liu

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.AI、cs.MM

Comments Accepted by KDD 2024 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03464 2024-06-25 cs.CV cs.CL econ.GN q-fin.EC 84%

Linking Representations with Multimodal Contrastive Learning

Abhishek Arora, Xinmei Yang, Shao-Yu Jheng, Melissa Dell

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04292 2024-06-07 cs.IR cs.CL cs.CV 84%

VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval

Junjie Zhou, Zheng Liu, Shitao Xiao, Bo Zhao, Yongping Xiong

专题命中 跨模态检索 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14612 2024-05-29 cs.CV cs.AI 84%

Explaining Multi-modal Large Language Models by Analyzing their Vision Perception

Loris Giulivi, Giacomo Boracchi

专题命中 跨模态检索 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Submitted at BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08021 2024-02-23 cs.LG cs.CL cs.MM 84%

StreaMulT: Streaming Multimodal Transformer for Heterogeneous and Arbitrary Long Sequential Data

Victor Pellegrain, Myriam Tami, Michel Batteux, Céline Hudelot

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.MM

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏