arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2504.03128 2025-04-07 cs.CV 57%

FontGuard: A Robust Font Watermarking Approach Leveraging Deep Font Knowledge

Kahim Wong, Jicheng Zhou, Kemou Li, Yain-Whar Si, Xiaowei Wu, Jiantao Zhou

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02397 2025-04-04 cs.CV 57%

Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval

Boseung Jeong, Jicheol Park, Sungyeon Kim, Suha Kwak

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02310 2025-04-04 cs.CL 57%

Improving Harmful Text Detection with Joint Retrieval and External Knowledge

Zidong Yu, Shuo Wang, Nan Jiang, Weiqiang Huang, Xu Han, Junliang Du

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11005 2025-04-03 cs.CV 57%

Cyclic Contrastive Knowledge Transfer for Open-Vocabulary Object Detection

Chuhan Zhang, Chaoyang Zhu, Pingcheng Dong, Long Chen, Dong Zhang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments 10 pages, 5 figures, Published as a conference paper at ICLR 2025

Journal ref Proceedings of the 13th International Conference on Learning Representations (ICLR 2025), Paper ID: 4226

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01009 2025-04-02 cs.CV 57%

GECKO: Gigapixel Vision-Concept Contrastive Pretraining in Histopathology

Saarthak Kapse, Pushpak Pati, Srikar Yellapragada, Srijan Das, Rajarsi R. Gupta, Joel Saltz, Dimitris Samaras, Prateek Prasanna

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14746 2025-04-02 cs.CV 57%

CoVR-2: Automatic Data Construction for Composed Video Retrieval

Lucas Ventura, Antoine Yang, Cordelia Schmid, Gül Varol

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments Appears in TPAMI 2024 (DOI: 10.1109/TPAMI.2024.3463799). Journal extension of the AAAI 2024 conference paper arXiv:2308.14746v3. Project page: https://imagine.enpc.fr/~ventural/covr/

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17007 2025-04-02 cs.CV 57%

Where am I? Cross-View Geo-localization with Natural Language Descriptions

Junyan Ye, Honglin Lin, Leyan Ou, Dairong Chen, Zihao Wang, Qi Zhu, Conghui He, Weijia Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07622 2025-04-01 cs.CV 57%

Pretrain like Your Inference: Masked Tuning Improves Zero-Shot Composed Image Retrieval

Junyang Chen, Hanjiang Lai

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments accepted by ICME 2025, this is the full version of paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22064 2025-03-31 cs.AI cs.SY eess.SY 57%

Multi-Task Semantic Communications via Large Models

Wanli Ni, Zhijin Qin, Haofeng Sun, Xiaoming Tao, Zhu Han

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19910 2025-03-26 cs.CV cs.IR 57%

CoLLM: A Large Language Model for Composed Image Retrieval

Chuong Huynh, Jinyu Yang, Ashish Tawari, Mubarak Shah, Son Tran, Raffay Hamid, Trishul Chilimbi, Abhinav Shrivastava

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://collm-cvpr25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18016 2025-03-25 cs.CV 57%

Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook

Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Lutao Jiang, Haiwei Xue, Bin Ren, Danda Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09313 2025-03-18 cs.CL cs.IR 57%

xVLM2Vec: Adapting LVLM-based embedding models to multilinguality using Self-Knowledge Distillation

Elio Musacchio, Lucia Siciliani, Pierpaolo Basile, Giovanni Semeraro

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments fix typo in number of tasks in MMEB; fix url for source code; added missing reference to XTD10

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15839 2025-03-18 cs.CV 57%

VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding

Jiaqi Wang, Yifei Gao, Jitao Sang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14594 2025-03-18 cs.CV cs.RO 57%

VXP: Voxel-Cross-Pixel Large-scale Image-LiDAR Place Recognition

Yun-Jin Li, Mariia Gladkova, Yan Xia, Rui Wang, Daniel Cremers

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Project page https://yunjinli.github.io/projects-vxp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08323 2025-03-12 cs.CL 57%

Towards Scalable and Cross-Lingual Specialist Language Models for Oncology

Morteza Rohanian, Tarun Mehra, Nicola Miglino, Farhad Nooralahzadeh, Michael Krauthammer, Andreas Wicki

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02162 2025-03-12 cs.CV cs.LG 57%

X2CT-CLIP: Enable Multi-Abnormality Detection in Computed Tomography from Chest Radiography via Tri-Modal Contrastive Learning

Jianzhong You, Yuan Gao, Sangwook Kim, Chris Mcintosh

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 11 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07306 2025-03-11 cs.CL 57%

Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies

Luyi Jiang, Jiayuan Chen, Lu Lu, Xinwei Peng, Lihao Liu, Junjun He, Jie Xu

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05204 2025-03-10 cs.CV 57%

Data-Efficient Generalization for Zero-shot Composed Image Retrieval

Zining Chen, Zhicheng Zhao, Fei Su, Xiaoqin Zhang, Shijian Lu

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19202 2025-03-10 cs.CL 57%

LiGT: Layout-infused Generative Transformer for Visual Question Answering on Vietnamese Receipts

Thanh-Phong Le, Trung Le Chi Phan, Nghia Hieu Nguyen, Kiet Van Nguyen

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments Accepted at IJDAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07335 2025-03-10 cs.LG cs.AI 57%

TempoGPT: Enhancing Time Series Reasoning via Quantizing Embedding

Haochuan Zhang, Chunhua Yang, Jie Han, Liyang Qin, Xiaoli Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07527 2025-03-06 cs.CL 57%

Prompt-enhanced Network for Hateful Meme Classification

Junxi Liu, Yanyan Feng, Jiehai Chen, Yun Xue, Fenghuan Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments Published in Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence Main Track. Pages 6397-6405

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00528 2025-03-04 cs.LG cs.CV 57%

Efficient Prompting for Continual Adaptation to Missing Modalities

Zirun Guo, Shulei Wang, Wang Lin, Weicai Yan, Yangyang Wu, Tao Jin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted to NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17000 2025-02-25 cs.CV cs.LG 57%

An Enhanced Large Language Model For Cross Modal Query Understanding System Using DL-KeyBERT Based CAZSSCL-MPGPT

Shreya Singh

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13576 2025-02-25 cs.CL cs.IR 57%

FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research

Jiajie Jin, Yutao Zhu, Guanting Dong, Yuyao Zhang, Xinyu Yang, Chenghao Zhang, Tong Zhao, Zhao Yang, Zhicheng Dou, Ji-Rong Wen

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments The paper is accepted by WWW2025 Resource Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13769 2025-02-20 cs.AI 57%

A consensus set for the aggregation of partial rankings: the case of the Optimal Set of Bucket Orders Problem

Juan A. Aledo, José A. Gámez, Alejandro Rosete

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02746 2025-02-20 cs.CV cs.LG 57%

Contrastive Localized Language-Image Pre-Training

Hong-You Chen, Zhengfeng Lai, Haotian Zhang, Xinze Wang, Marcin Eichner, Keen You, Meng Cao, Bowen Zhang, Yinfei Yang, Zhe Gan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11431 2025-02-18 cs.CL 57%

Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information Retrieval

Ze Liu, Zhengyang Liang, Junjie Zhou, Zheng Liu, Defu Lian

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01476 2025-02-14 cs.DB cs.AI cs.LG 57%

Optimizing Context-Enhanced Relational Joins

Viktor Sanca, Manos Chatzakis, Anastasia Ailamaki

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08254 2025-02-13 cs.CV 57%

UniCoRN: Unified Commented Retrieval Network with LMMs

Maximilian Jaritz, Matthieu Guillaumin, Sabine Sternig, Loris Bazzani

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06385 2025-02-11 cs.CV 57%

AMNS: Attention-Weighted Selective Mask and Noise Label Suppression for Text-to-Image Person Retrieval

Runqing Zhang, Xue Zhou

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏