arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3450 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3450 篇

2502.11633 2025-02-18 cs.CL 79%

CLASS: Enhancing Cross-Modal Text-Molecule Retrieval Performance and Training Efficiency

Hongyan Wu, Peijian Zeng, Weixiong Zheng, Lianxi Wang, Nankai Lin, Shengyi Jiang, Aimin Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CL

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10704 2025-02-12 cs.CL 79%

VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation

Manan Suri, Puneet Mathur, Franck Dernoncourt, Kanika Goswami, Ryan A. Rossi, Dinesh Manocha

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07121 2025-02-11 cs.LG cs.CL 79%

Bridging the Gap for Test-Time Multimodal Sentiment Analysis

Zirun Guo, Tao Jin, Wenlong Xu, Wang Lin, Yangyang Wu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08521 2025-02-10 cs.IR cs.CL 79%

MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering

Zhengyuan Zhu, Daniel Lee, Hong Zhang, Sai Sree Harsha, Loic Feujio, Akash Maharaj, Yunyao Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01074 2025-02-03 cs.CV 79%

AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis

Qiuhui Chen, Yi Hong

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV

Comments BIBM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19540 2025-01-31 cs.LG cs.AI 79%

Overcoming Uncertain Incompleteness for Robust Multimodal Sequential Diagnosis Prediction via Curriculum Data Erasing Guided Knowledge Distillation

Heejoon Koo

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by ICASSP 2025 (2025 IEEE International Conference on Acoustics, Speech, and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07304 2025-01-14 cs.CV cs.LG 79%

Code and Pixels: Multi-Modal Contrastive Pre-training for Enhanced Tabular Data Analysis

Kankana Roy, Lars Krämer, Sebastian Domaschke, Malik Haris, Roland Aydin, Fabian Isensee, Martin Held

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04695 2025-01-09 cs.LG cs.CV cs.IR cs.IT math.IT 79%

Re-ranking the Context for Multimodal Retrieval Augmented Generation

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03995 2025-01-08 cs.LG cs.CV cs.IR cs.IT math.IT 79%

RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01066 2025-01-03 cs.MM 79%

DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations

Qiya Song, Jiajun Hu, Lin Xiao, Bin Sun, Xieping Gao, Shutao Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13069 2024-12-30 cs.CV cs.LG 79%

General-Purpose Multi-Modal OOD Detection Framework

Viet Duong, Qiong Wu, Zhengyi Zhou, Eric Zavesky, Jiahe Chen, Xiangzhou Liu, Wen-Ling Hsu, Huajie Shao

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14880 2024-12-20 cs.CV 79%

Multimodal Hypothetical Summary for Retrieval-based Multi-image Question Answering

Peize Li, Qingyi Si, Peng Fu, Zheng Lin, Yan Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13834 2024-12-19 cs.IR cs.AI cs.LG 79%

Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval

Giacomo Pacini, Fabio Carrara, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.AI

Comments 15 pages, 5 figures. To be published as full paper in the Proceedings of the European Conference on Information Retrieval (ECIR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05843 2024-12-10 cs.CL cs.LG 79%

A Self-Learning Multimodal Approach for Fake News Detection

Hao Chen, Hui Guo, Baochen Hu, Shu Hu, Jinrong Hu, Siwei Lyu, Xi Wu, Xin Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00756 2024-12-10 cs.CL 79%

Multi-View Incongruity Learning for Multimodal Sarcasm Detection

Diandian Guo, Cong Cao, Fangfang Yuan, Yanbing Liu, Guangjie Zeng, Xiaoyan Yu, Hao Peng, Philip S. Yu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05155 2024-12-09 cs.CL 79%

Multimodal Fact-Checking with Vision Language Models: A Probing Classifier based Solution with Embedding Strategies

Recep Firat Cekinel, Pinar Karagoz, Cagri Coltekin

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06220 2024-12-05 cs.LG cs.MM 79%

Zero-Shot Relational Learning for Multimodal Knowledge Graphs

Rui Cai, Shichao Pei, Xiangliang Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

Comments In the Proceedings of the 2024 IEEE International Conference on Big Data (IEEE BigData 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01299 2024-12-03 cs.CV cs.RO 79%

Cross-Modal Visual Relocalization in Prior LiDAR Maps Utilizing Intensity Textures

Qiyuan Shen, Hengwang Zhao, Weihao Yan, Chunxiang Wang, Tong Qin, Ming Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16020 2024-11-26 cs.CL 79%

TransCompressor: LLM-Powered Multimodal Data Compression for Smart Transportation

Huanqi Yang, Rucheng Wu, Weitao Xu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15576 2024-11-26 eess.IV cs.CV 79%

MulModSeg: Enhancing Unpaired Multi-Modal Medical Image Segmentation with Modality-Conditioned Text Embedding and Alternating Training

Chengyin Li, Hui Zhu, Rafi Ibn Sultan, Hassan Bagher Ebadian, Prashant Khanduri, Chetty Indrin, Kundan Thind, Dongxiao Zhu

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by WACV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14704 2024-11-25 cs.CV cs.IR 79%

Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval

Zengbao Sun, Ming Zhao, Gaorui Liu, André Kaup

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 62, pp. 1-18, 2024, Art no. 4709118

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06229 2024-11-12 cs.AI 79%

Multimodal Contrastive Learning of Urban Space Representations from POI Data

Xinglei Wang, Tao Cheng, Stephen Law, Zichao Zeng, Lu Yin, Junyuan Liu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06176 2024-11-12 cs.CL 79%

M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework

Yew Ken Chia, Liying Cheng, Hou Pong Chan, Chaoqun Liu, Maojia Song, Sharifah Mahani Aljunied, Soujanya Poria, Lidong Bing

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05900 2024-11-12 cs.CV cs.LG 79%

Enhancing Cardiovascular Disease Prediction through Multi-Modal Self-Supervised Learning

Francesco Girlanda, Olga Demler, Bjoern Menze, Neda Davoudi

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted to British Machine Vision Conference (BMVC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02534 2024-11-06 eess.IV cs.CV 79%

Multi-modal Spatial Clustering for Spatial Transcriptomics Utilizing High-resolution Histology Images

Bingjun Li, Mostafa Karami, Masum Shah Junayed, Sheida Nabavi

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18104 2024-10-25 cs.NI cs.AI 79%

ENWAR: A RAG-empowered Multi-Modal LLM Framework for Wireless Environment Perception

Ahmad M. Nazar, Abdulkadir Celik, Mohamed Y. Selim, Asmaa Abdallah, Daji Qiao, Ahmed M. Eltawil

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11321 2024-10-16 cs.CL 79%

Self-adaptive Multimodal Retrieval-Augmented Generation

Wenjia Zhai

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06285 2024-10-10 cs.CV cs.RO 79%

Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching

Gongxin Yao, Xinyang Li, Luowei Fu, Yu Pan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13395 2024-10-10 cs.CV cs.RO 79%

Unifying Local and Global Multimodal Features for Place Recognition in Aliased and Low-Texture Environments

Alberto García-Hernández, Riccardo Giubilato, Klaus H. Strobl, Javier Civera, Rudolph Triebel

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments Accepted submission to International Conference on Robotics and Automation (ICRA), 2024

Journal ref 2024 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01160 2024-10-03 cs.IR cs.CV 79%

GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network

Panfeng Cao, Jian Wu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Journal ref Pattern Recognition Volume 140, August 2023, 109542

详情

展开后加载摘要…

URL PDF HTML 收藏