arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2401.17244 2024-10-11 cs.CL cond-mat.mtrl-sci cs.AI 62%

LLaMP: Large Language Model Made Powerful for High-fidelity Materials Knowledge Retrieval and Distillation

Yuan Chiang, Elvis Hsieh, Chia-Hong Chou, Janosh Riebesell

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06314 2024-10-10 cs.CV cs.CL 62%

Temporal Image Caption Retrieval Competition -- Description and Results

Jakub Pokrywka, Piotr Wierzchoń, Kornel Weryszko, Krzysztof Jassem

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Journal ref Proceedings of the 18th Conference on Computer Science and Intelligence Systems, M. Ganzha, L. Maciaszek, M. Paprzycki, D. Ślęzak (eds). ACSIS, Vol. 35, pages 1331-1336 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13119 2024-09-12 cs.CL cs.SD eess.AS 62%

Coarse-to-fine Alignment Makes Better Speech-image Retrieval

Lifeng Zhou, Yuke Li

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12023 2024-08-23 cs.LG cs.CL cs.CV 62%

Limitations in Employing Natural Language Supervision for Sensor-Based Human Activity Recognition -- And Ways to Overcome Them

Harish Haresamudram, Apoorva Beedu, Mashfiqui Rabbi, Sankalita Saha, Irfan Essa, Thomas Ploetz

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06259 2024-08-13 cs.CL cs.CV 62%

Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning

Yingjin Song, Denis Paperno, Albert Gatt

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 18 pages, 12 figures, accepted by INLG 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11317 2024-08-08 cs.CV cs.AI 62%

Improving Composed Image Retrieval via Contrastive Learning with Scaling Positives and Negatives

Zhangchi Feng, Richong Zhang, Zhijie Nie

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACM MM 2024 Regular Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13851 2024-07-22 cs.CV cs.LG cs.MM 62%

X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs

Sirnam Swetha, Jinyu Yang, Tal Neiman, Mamshad Nayeem Rizve, Son Tran, Benjamin Yao, Trishul Chilimbi, Mubarak Shah

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted at ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07143 2024-07-16 cs.LG cs.AI cs.CV 62%

Reproducible scaling laws for contrastive language-image learning

Mehdi Cherti, Romain Beaumont, Ross Wightman, Mitchell Wortsman, Gabriel Ilharco, Cade Gordon, Christoph Schuhmann, Ludwig Schmidt, Jenia Jitsev

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

Comments CVPR 2023. Version with minor extension. Original: CVPR2023/html/Cherti_Reproducible_Scaling_Laws_for_Contrastive_Language-Image_Learning_CVPR_2023_paper" target="_blank" rel="noopener">https://openaccess.thecvf.com/content/CVPR2023/html/Cherti_Reproducible_Scaling_Laws_for_Contrastive_Language-Image_Learning_CVPR_2023_paper

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023, pp. 2818-2829

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06611 2024-07-10 cs.CV cs.AI 62%

CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding

Wenhao Xu, Wenming Weng, Yueyi Zhang, Zhiwei Xiong

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01408 2024-07-02 cs.CV cs.AI cs.LG 62%

Semantic Compositions Enhance Vision-Language Contrastive Learning

Maxwell Aladago, Lorenzo Torresani, Soroush Vosoughi

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18587 2024-06-28 cs.CV cs.AI 62%

Nomic Embed Vision: Expanding the Latent Space

Zach Nussbaum, Brandon Duderstadt, Andriy Mulyar

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01065 2024-06-19 cs.CV cs.AI 62%

BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving

Tao Tang, Dafeng Wei, Zhengyu Jia, Tian Gao, Changwei Cai, Chengkai Hou, Peng Jia, Kun Zhan, Haiyang Sun, Jingchen Fan, Yixing Zhao, Fu Liu, Xiaodan Liang, Xianpeng Lang, Yang Wang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18570 2024-06-10 cs.CV cs.CL cs.IR cs.LG 62%

It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap

Abrar Fahim, Alex Murphy, Alona Fyshe

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03158 2024-06-06 cs.CL cs.AI 62%

CSS: Contrastive Semantic Similarity for Uncertainty Quantification of LLMs

Shuang Ao, Stefan Rueger, Advaith Siddharthan

专题命中 跨模态检索 :image-text(abstract);分类 cs.CL、cs.AI

Comments The paper is accepted by The Conference on Uncertainty in Artificial Intelligence (UAI), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20245 2024-05-31 cs.CL cs.AI cs.IR cs.LG 62%

Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use

Franz Louis Cesista, Rui Aguiar, Jason Kim, Paolo Acilo

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE 7th International Conference on Multimedia Information Processing and Retrieval (MIPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14084 2024-05-28 cs.IR cs.AI cs.CV 62%

Invisible Relevance Bias: Text-Image Retrieval Models Prefer AI-Generated Images

Shicheng Xu, Danyang Hou, Liang Pang, Jingcheng Deng, Jun Xu, Huawei Shen, Xueqi Cheng

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by SIGIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09286 2024-05-16 cs.MM cs.CV 62%

MVBIND: Self-Supervised Music Recommendation For Videos Via Embedding Space Binding

Jiajie Teng, Huiyu Duan, Yucheng Zhu, Sijing Wu, Guangtao Zhai

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01468 2024-05-03 cs.LG cs.AI cs.CV 62%

Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models

Yifei Ming, Yixuan Li

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments The paper is accepted at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19360 2024-05-01 cs.CV cs.CL cs.IR 62%

Large Language Model Informed Patent Image Retrieval

Hao-Cheng Lo, Jung-Mei Chu, Jieh Hsiang, Chun-Chieh Cho

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 8 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03798 2024-04-18 cs.CV cs.AI cs.LG cs.NE 62%

Fooling Contrastive Language-Image Pre-trained Models with CLIPMasterPrints

Matthias Freiberger, Peter Kun, Christian Igel, Anders Sundnes Løvlie, Sebastian Risi

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments This work was supported by a research grant (40575) from VILLUM FONDEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10241 2024-04-17 cs.CV cs.AI 62%

Vision-and-Language Navigation via Causal Learning

Liuyi Wang, Zongtao He, Ronghao Dang, Mengjiao Shen, Chengju Liu, Qijun Chen

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05902 2024-04-10 cs.CL cs.AI 62%

WILBUR: Adaptive In-Context Learning for Robust and Accurate Web Agents

Michael Lutz, Arth Bohra, Manvel Saroyan, Artem Harutyunyan, Giovanni Campagna

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05502 2024-04-09 cs.CL cs.AI 62%

PetKaz at SemEval-2024 Task 3: Advancing Emotion Classification with an LLM for Emotion-Cause Pair Extraction in Conversations

Roman Kazakov, Kseniia Petukhova, Ekaterina Kochmar

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 7 figures, 2 tables, to be published in the Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024), for associated code, see https://github.com/sachertort/petkaz-semeval-ecac

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03323 2024-04-05 cs.CV cs.AI 62%

Sparse Concept Bottleneck Models: Gumbel Tricks in Contrastive Learning

Andrei Semenov, Vladimir Ivanov, Aleksandr Beznosikov, Alexander Gasnikov

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 1 algorithm, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15276 2024-04-04 cs.IR cs.AI cs.CV 62%

CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora

Zijun Long, Xuri Ge, Richard Mccreadie, Joemon Jose

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14551 2024-03-22 cs.CL cs.AI cs.LG 62%

Lexicon-Level Contrastive Visual-Grounding Improves Language Modeling

Chengxu Zhuang, Evelina Fedorenko, Jacob Andreas

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07952 2024-03-19 cs.CV cs.CL cs.LG 62%

MOFI: Learning Image Representations from Noisy Entity Annotated Images

Wentao Wu, Aleksei Timofeev, Chen Chen, Bowen Zhang, Kun Duan, Shuangning Liu, Yantao Zheng, Jonathon Shlens, Xianzhi Du, Zhe Gan, Yinfei Yang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00691 2024-03-04 cs.CV cs.AI 62%

Tri-Modal Motion Retrieval by Learning a Joint Embedding Space

Kangning Yin, Shihao Zou, Yuxuan Ge, Zheng Tian

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15103 2024-02-26 cs.LG cs.AI cs.CV 62%

Contrastive Learning Is Spectral Clustering On Similarity Graph

Zhiquan Tan, Yifan Zhang, Jingqin Yang, Yang Yuan

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2024; We express our gratitude to the anonymous reviewers for their valuable feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10921 2024-02-20 cs.AI cs.CV cs.LG 62%

AM^2-EmoJE: Adaptive Missing-Modality Emotion Recognition in Conversation via Joint Embedding Learning

Naresh Kumar Devulapally, Sidharth Anand, Sreyasee Das Bhattacharjee, Junsong Yuan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏