arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3437 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3437 篇

2305.12767 2023-10-17 cs.CV cs.AI cs.CL 82%

D$^2$TV: Dual Knowledge Distillation and Target-oriented Vision Modeling for Many-to-Many Multimodal Summarization

Yunlong Liang, Fandong Meng, Jiaan Wang, Jinan Xu, Yufeng Chen, Jie Zhou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01919 2023-08-07 cs.MM cs.AI cs.CV 82%

Emotion recognition based on multi-modal electrophysiology multi-head attention Contrastive Learning

Yunfei Guo, Tao Zhang, Wu Huang

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments arXiv admin note: text overlap with arXiv:2208.00877 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09484 2023-07-24 q-bio.BM cs.CE cs.LG physics.chem-ph 82%

MolFM: A Multimodal Molecular Foundation Model

Yizhen Luo, Kai Yang, Massimo Hong, Xing Yi Liu, Zaiqing Nie

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

Comments 31 pages, 15 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10632 2023-07-19 cs.IR 82%

Multi-Modal Self-Supervised Learning for Recommendation

Wei Wei, Chao Huang, Lianghao Xia, Chuxu Zhang

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

Comments This paper has been published as a full paper at WWW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13823 2023-06-16 cs.CL cs.AI cs.CV cs.LG 82%

Grounding Language Models to Images for Multimodal Inputs and Outputs

Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published in ICML 2023. Project page: https://jykoh.com/fromage

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00020 2023-05-17 cs.LG cs.AI cs.CL cs.CV 82%

SemiMemes: A Semi-supervised Learning Approach for Multimodal Memes Analysis

Pham Thai Hoang Tung, Nguyen Tan Viet, Ngo Tien Anh, Phan Duy Hung

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICCCI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11095 2023-04-24 cs.LG cs.AI cs.CL cs.CV cs.IR 82%

Is Cross-modal Information Retrieval Possible without Training?

Hyunjin Choi, Hyunjae Lee, Seongho Joe, Youngjune L. Gwon

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref Advances in Information Retrieval: 45th European Conference on Information Retrieval, ECIR 2023, Dublin, Ireland, Proceedings, Part II

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12764 2023-03-23 cs.CV cs.AI cs.CL 82%

VoP: Text-Video Co-operative Prompt Tuning for Cross-Modal Retrieval

Siteng Huang, Biao Gong, Yulin Pan, Jianwen Jiang, Yiliang Lv, Yuyuan Li, Donglin Wang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13764 2022-09-29 cs.IR 82%

Mr. Right: Multimodal Retrieval on Representation of ImaGe witH Text

Cheng-An Hsieh, Cheng-Ping Hsieh, Pu-Jen Cheng

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

Comments Dataset available at https://github.com/hsiehjackson/Mr.Right

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.00693 2022-07-29 cs.IR cs.AI cs.CL cs.CV 82%

Multimodal Entity Tagging with Multimodal Knowledge Base

Hao Peng, Hang Li, Lei Hou, Juanzi Li, Chao Qiao

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11482 2022-07-26 cs.CV cs.AI cs.LG cs.MM 82%

Multimodal Emotion Recognition with Modality-Pairwise Unsupervised Contrastive Loss

Riccardo Franceschini, Enrico Fini, Cigdem Beyan, Alessandro Conti, Federica Arrigoni, Elisa Ricci

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to 26th International Conference on Pattern Recognition (ICPR) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10172 2022-04-22 eess.AS cs.AI cs.CL 82%

Gated Multimodal Fusion with Contrastive Learning for Turn-taking Prediction in Human-robot Dialogue

Jiudong Yang, Peiying Wang, Yi Zhu, Mingchao Feng, Meng Chen, Xiaodong He

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted by ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.08549 2019-10-22 cs.CL cs.AI cs.CV cs.HC cs.LG 82%

Towards Learning Cross-Modal Perception-Trace Models

Achim Rettinger, Viktoria Bogdanova, Philipp Niemann

专题命中 跨模态检索 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12203 2019-05-30 cs.LG stat.ML 82%

Weakly-paired Cross-Modal Hashing

Xuanwu Liu, Jun Wang, Guoxian Yu, Carlotta Domeniconi, Xiangliang Zhang

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.09648 2019-05-28 cs.CL cs.AI cs.CV 82%

Adapting Visual Question Answering Models for Enhancing Multimodal Community Q&A Platforms

Avikalp Srivastava, Hsin Wen Liu, Sumio Fujita

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Submitted for review at CIKM 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.00682 2019-05-24 cs.IR 82%

Learning Decorrelated Hashing Codes for Multimodal Retrieval

Dayong Tian

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.04450 2019-05-14 cs.LG stat.ML 82%

Ranking-based Deep Cross-modal Hashing

Xuanwu Liu, Guoxian Yu, Carlotta Domeniconi, Jun Wang, Yazhou Ren, Maozu Guo

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.00644 2019-02-05 cs.IR 82%

Joint Cluster Unary Loss for Efficient Cross-Modal Hashing

Shifeng Zhang, Jianmin Li, Bo Zhang

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.11303 2018-10-29 cs.IR 82%

Investigating non-classical correlations between decision fused multi-modal documents

Dimitris Gkoumas, Sagar Uprety, Dawei Song

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04318 2018-04-26 cs.CV cs.AI cs.MM 82%

Cross-Modal Retrieval with Implicit Concept Association

Yale Song, Mohammad Soleymani

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06794 2018-03-02 cs.CV cs.AI cs.CL 82%

Co-attending Free-form Regions and Detections with Multi-modal Multiplicative Feature Embedding for Visual Question Answering

Pan Lu, Hongsheng Li, Wei Zhang, Jianyong Wang, Xiaogang Wang

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear in AAAI 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04776 2017-08-17 cs.CV cs.CL cs.MM 82%

Modality-specific Cross-modal Similarity Measurement with Recurrent Attention Network

Yuxin Peng, Jinwei Qi, Yuxin Yuan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.MM

Comments 13 pages, submitted to IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.01229 2017-07-11 cs.LG stat.ML 82%

Simple to Complex Cross-modal Learning to Rank

Minnan Luo, Xiaojun Chang, Zhihui Li, Liqiang Nie, Alexander G. Hauptmann, Qinghua Zheng

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract)

Comments 14 pages; Accepted by Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
1504.04818 2016-05-24 cs.IR 82%

Composite Correlation Quantization for Efficient Multimodal Retrieval

Mingsheng Long, Yue Cao, Jianmin Wang, Philip S. Yu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV 82%

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02365 2026-01-07 cs.IR cs.AI cs.CL cs.LG 82%

FUSE : Failure-aware Usage of Subagent Evidence for MultiModal Search and Recommendation

FUSE : 多模态搜索与推荐中子代理证据的故障感知使用

Tushar Vatsa, Vibha Belavadi, Priya Shanmugasundaram, Suhas Suresha, Dewang Sultania

机构 * Adobe Inc.(Adobe公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 FUSE通过上下文压缩策略提升多模态搜索与推荐性能,实现93.3%的意图准确率和99.4%的召回率。

Comments ICDM MMSR 2025: Workshop on Multimodal Search and Recommendations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15201 2026-01-07 cs.CV cs.MM 82%

Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval

迈向食品图像到食谱检索的无偏跨模态表示学习

Qing Wang, Chong-Wah Ngo, Ee-Peng Lim

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文通过因果理论解决食品图像到食谱检索中的偏见问题,提出因果干预方法和多标签分类器,提升检索性能。

Comments Code link: https://github.com/GZWQ/Towards-Unbiased-Cross-Modal-Representation-Learning-for-Food-Image-to-Recipe-Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13374 2025-07-21 cs.CV cs.AI cs.IR 82%

Smart Routing for Multimodal Video Retrieval: When to Search What

Kevin Dela Rosa

机构 * Cloudglue

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025 Multimodal Representation and Retrieval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07303 2024-09-24 cs.CV cs.CL cs.LG 82%

Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion

Peiyuan Chen, Zecheng Zhang, Yiping Dong, Li Zhou, Han Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.13552 2021-06-28 cs.CV cs.AI 82%

Graph Pattern Loss based Diversified Attention Network for Cross-Modal Retrieval

Xueying Chen, Rong Zhang, Yibing Zhan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 5 pages, 3 figures

Journal ref [1] Chen X , Zhang R , Zhan Y . Graph Pattern Loss Based Diversified Attention Network For Cross-Modal Retrieval[C]// 2020 IEEE International Conference on Image Processing (ICIP). IEEE, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏