arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2502.01549 2025-02-04 cs.IR cs.AI cs.CV 62%

VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos

Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, Chao Huang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01056 2025-02-04 cs.CV cs.CL 62%

Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding

Chao Wang, Xuancheng Zhou, Weiwei Fu, Yang Zhou

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11667 2025-02-04 cs.LG cs.AI cs.CV 62%

Dissecting Representation Misalignment in Contrastive Learning via Influence Function

Lijie Hu, Chenyang Ren, Huanyi Xie, Khouloud Saadi, Shu Yang, Zhen Tan, Jingfeng Zhang, Di Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09827 2025-01-24 cs.CL cs.CV cs.DC cs.LG 62%

A Training-free Sub-quadratic Cost Transformer Model Serving Framework With Hierarchically Pruned Attention

Heejun Lee, Geon Park, Youngwan Lee, Jaduk Suh, Jina Kim, Wonyoung Jeong, Bumsik Kim, Hyemin Lee, Myeongjae Jeon, Sung Ju Hwang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05128 2025-01-23 cs.CL cs.AI 62%

Enhancing textual textbook question answering with large language models and retrieval augmented generation

Hessa Abdulrahman Alawwad, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Journal ref Pattern Recognition, Volume 162, 2025, Article 111332

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05238 2025-01-13 cs.CV cs.AI cs.LG 62%

FOCUS: Towards Universal Foreground Segmentation

Zuyao You, Lingyu Kong, Lingchen Meng, Zuxuan Wu

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02285 2025-01-08 cs.CV cs.AI 62%

Hyperbolic Contrastive Learning for Hierarchical 3D Point Cloud Embedding

Yingjie Liu, Pengyu Zhang, Ziyao He, Mingsong Chen, Xuan Tang, Xian Wei

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09472 2025-01-07 cs.SD cs.AI eess.AS 62%

DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning

Xiquan Li, Wenxi Chen, Ziyang Ma, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Qiuqiang Kong, Xie Chen

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05831 2024-12-24 cs.MM cs.SD eess.AS 62%

Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval

Shanti Stewart, Gouthaman KV, Lie Lu, Andrea Fanelli

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15262 2024-12-23 cs.CL cs.AI cs.IR 62%

Advanced ingestion process powered by LLM parsing for RAG system

Arnau Perez, Xavier Vizcaino

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14384 2024-12-20 cs.LG cs.AI cs.CV 62%

I0T: Embedding Standardization Method Towards Zero Modality Gap

Na Min An, Eunki Kim, James Thorne, Hyunjung Shim

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

Comments 16 figures, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10761 2024-12-17 cs.CV cs.AI 62%

Rebalanced Vision-Language Retrieval Considering Structure-Aware Distillation

Yang Yang, Wenjuan Xi, Luping Zhou, Jinhui Tang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13282 2024-12-17 cs.CV cs.MM 62%

Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding

Guangyin Bao, Qi Zhang, Zixuan Gong, Jialei Zhou, Wei Fan, Kun Yi, Usman Naseem, Liang Hu, Duoqian Miao

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments AAAI 2025, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10348 2024-12-16 cs.CV cs.AI 62%

A dual contrastive framework

Yuan Sun, Zhao Zhang, Jorge Ortiz

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10155 2024-12-16 cs.CV cs.AI 62%

WordVIS: A Color Worth A Thousand Words

Umar Khan, Saifullah, Stefan Agne, Andreas Dengel, Sheraz Ahmed

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08231 2024-12-12 cs.CV cs.AI 62%

Dynamic Modality-Camera Invariant Clustering for Unsupervised Visible-Infrared Person Re-identification

Yiming Yang, Weipeng Hu, Haifeng Hu

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12610 2024-12-10 cs.MM cs.SD eess.AS 62%

Emotion-Aligned Contrastive Learning Between Images and Music

Shanti Stewart, Kleanthis Avramidis, Tiantian Feng, Shrikanth Narayanan

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments Published at ICASSP 2024. Code: https://github.com/shantistewart/Emo-CLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03957 2024-12-06 cs.CV cs.AI 62%

A Framework For Image Synthesis Using Supervised Contrastive Learning

Yibin Liu, Jianyu Zhang, Li Zhang, Shijian Li, Gang Pan

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00120 2024-12-03 cs.CV cs.AI 62%

Relation-Aware Meta-Learning for Zero-shot Sketch-Based Image Retrieval

Yang Liu, Jiale Du, Xinbo Gao, Jungong Han

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11875 2024-11-20 cs.IR cs.AI cs.CL q-bio.BM 62%

Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval

Zijun Min, Bingshuai Liu, Liang Zhang, Jia Song, Jinsong Su, Song He, Xiaochen Bo

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments BIBM 2024 Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09723 2024-11-18 cs.CV cs.AI 62%

Towards Neural Foundation Models for Vision: Aligning EEG, MEG, and fMRI Representations for Decoding, Encoding, and Modality Conversion

Matteo Ferrante, Tommaso Boccato, Grigorii Rashkov, Nicola Toschi

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17601 2024-11-18 cs.CV cs.AI 62%

CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for Backdoor Defense in Contrastive Learning

Yuan Xun, Siyuan Liang, Xiaojun Jia, Xinwei Liu, Xiaochun Cao

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06001 2024-11-13 cs.CV cs.MM 62%

Pseudo-triplet Guided Few-shot Composed Image Retrieval

Bohan Hou, Haoqiang Lin, Haokun Wen, Meng Liu, Mingzhu Xu, Xuemeng Song

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11327 2024-11-05 cs.CL cs.AI 62%

Plug, Play, and Fuse: Zero-Shot Joint Decoding via Word-Level Re-ranking Across Diverse Vocabularies

Sai Koneru, Matthias Huck, Miriam Exel, Jan Niehues

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

Comments WMT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09952 2024-11-05 cs.CV cs.CL cs.LG 62%

BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to NeurIPS 24 Datasets and Benchmarks Track; Project page at: https://imirandam.github.io/BiVLC_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14702 2024-11-01 cs.CV cs.AI 62%

G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models

Pengyue Jia, Yiding Liu, Xiaopeng Li, Yuhao Wang, Yantong Du, Xiao Han, Xuetao Wei, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08110 2024-10-31 cs.CL cs.CV 62%

Improving Hateful Meme Detection through Retrieval-Guided Contrastive Learning

Jingbiao Mei, Jinghong Chen, Weizhe Lin, Bill Byrne, Marcus Tomalin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

Comments ACL 2024 Main. The code is available from: https://github.com/JingbiaoMei/RGCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21318 2024-10-30 cs.CV cs.AI 62%

Multi-path Exploration and Feedback Adjustment for Text-to-Image Person Retrieval

Bin Kang, Bin Chen, Junjie Wang, Yong Xu

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10184 2024-10-15 cs.CV cs.AI 62%

Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention

Ying Liu, Ge Bai, Chenji Lu, Shilong Li, Zhang Zhang, Ruifang Liu, Wenbin Guo

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Journal ref 2024 IEEE International Conference on Multimedia and Expo (ICME), Niagara Falls, ON, Canada, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08593 2024-10-14 cs.CV cs.AI 62%

VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding

Houlun Chen, Xin Wang, Hong Chen, Zeyang Zhang, Wei Feng, Bin Huang, Jia Jia, Wenwu Zhu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by 38th NeurIPS Datasets & Benchmarks Track (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏