arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2404.04667 2024-04-09 cs.AI q-bio.TO 57%

Autonomous Artificial Intelligence Agents for Clinical Decision Making in Oncology

Dyke Ferber, Omar S. M. El Nahhas, Georg Wölflein, Isabella C. Wiest, Jan Clusmann, Marie-Elisabeth Leßman, Sebastian Foersch, Jacqueline Lammert, Maximilian Tschochohei, Dirk Jäger, Manuel Salto-Tellez, Nikolaus Schultz, Daniel Truhn, Jakob Nikolas Kather

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

Comments 91 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00262 2024-04-02 cs.CV 57%

Image-to-Image Matching via Foundation Models: A New Perspective for Open-Vocabulary Semantic Segmentation

Yuan Wang, Rui Sun, Naisong Luo, Yuwen Pan, Tianzhu Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18178 2024-03-28 cs.RO cs.CV 57%

Online Embedding Multi-Scale CLIP Features into 3D Maps

Shun Taguchi, Hideki Deguchi

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01629 2024-03-28 cs.CV 57%

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11708 2024-03-27 cs.CV 57%

Implicit Discriminative Knowledge Learning for Visible-Infrared Person Re-Identification

Kaijie Ren, Lei Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16005 2024-03-26 cs.CV 57%

Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval

Yucheng Suo, Fan Ma, Linchao Zhu, Yi Yang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08924 2024-03-26 cs.CV 57%

Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking

Shitong Sun, Fanghua Ye, Shaogang Gong

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12053 2024-03-21 cs.MM 57%

PiGW: A Plug-in Generative Watermarking Framework

Rui Ma, Mengxi Guo, Li Yuming, Hengyuan Zhang, Cong Ma, Yuan Li, Xiaodong Xie, Shanghang Zhang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

Comments Improve experimental content

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12747 2024-03-20 cs.CV 57%

N-Modal Contrastive Losses with Applications to Social Media Data in Trimodal Space

William Theisen, Walter Scheirer

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02628 2024-03-20 cs.CV cs.LG 57%

Interactive Continual Learning: Fast and Slow Thinking

Biqing Qi, Xingquan Chen, Junqi Gao, Dong Li, Jianxing Liu, Ligang Wu, Bowen Zhou

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04183 2024-03-08 cs.CV 57%

YYDS: Visible-Infrared Person Re-Identification with Coarse Descriptions

Yunhao Du, Zhicheng Zhao, Fei Su

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05203 2024-03-06 cs.CL 57%

From Artificially Real to Real: Leveraging Pseudo Data from Large Language Models for Low-Resource Molecule Discovery

Yuhan Chen, Nuwa Xi, Yanrui Du, Haochun Wang, Jianyu Chen, Sendong Zhao, Bing Qin

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

Comments AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08229 2024-03-04 cs.CR cs.CV cs.LG 57%

CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning

Jinghuai Zhang, Hongbin Liu, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19014 2024-03-01 cs.CV 57%

Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models

Xin Li, Yunfei Wu, Xinghua Jiang, Zhihao Guo, Mingming Gong, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09291 2024-02-27 cs.CV 57%

Vision-by-Language for Training-Free Compositional Image Retrieval

Shyamgopal Karthik, Karsten Roth, Massimiliano Mancini, Zeynep Akata

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16350 2024-02-27 cs.CV 57%

Impression-CLIP: Contrastive Shape-Impression Embedding for Fonts

Yugo Kubota, Daichi Haraguchi, Seiichi Uchida

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07843 2024-02-27 cs.CL 57%

Error-Robust Retrieval for Chinese Spelling Check

Xunjian Yin, Xinyu Hu, Jin Jiang, Xiaojun Wan

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10894 2024-02-19 cs.CV cs.LG 57%

Fusion of Diffusion Weighted MRI and Clinical Data for Predicting Functional Outcome after Acute Ischemic Stroke with Deep Contrastive Learning

Chia-Ling Tsai, Hui-Yun Su, Shen-Feng Sung, Wei-Yang Lin, Ying-Ying Su, Tzu-Hsien Yang, Man-Lin Mai

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07418 2024-02-13 cs.AI 57%

SemTra: A Semantic Skill Translator for Cross-Domain Zero-Shot Policy Adaptation

Sangwoo Shin, Minjong Yoo, Jeongwoo Lee, Honguk Woo

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

Comments AAAI 2024 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14826 2024-01-29 cs.SD cs.IR eess.AS 57%

Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings

Shreyan Chowdhury, Gerhard Widmer

专题命中 跨模态检索 :cross-modal(abstract);分类 eess.AS

Comments Presented at FIRE 2023 (Forum for Information Retrieval Evaluation) conference, Goa, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14148 2024-01-26 cs.CV 57%

LanDA: Language-Guided Multi-Source Domain Adaptation

Zhenbin Wang, Lei Zhang, Lituan Wang, Minjuan Zhu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07207 2024-01-17 cs.CV 57%

Unsupervised Domain Adaptation Using Compact Internal Representations

Mohammad Rostami

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05628 2024-01-17 cs.CL cs.CE cs.CY 57%

Glitter or Gold? Deriving Structured Insights from Sustainability Reports via Large Language Models

Marco Bronzini, Carlo Nicolini, Bruno Lepri, Andrea Passerini, Jacopo Staiano

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04860 2024-01-11 cs.CV 57%

Modality-Aware Representation Learning for Zero-shot Sketch-based Image Retrieval

Eunyi Lyou, Doyeon Lee, Jooeun Kim, Joonseok Lee

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted at WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01181 2024-01-03 cs.CV 57%

Query-Based Knowledge Sharing for Open-Vocabulary Multi-Label Classification

Xuelin Zhu, Jian Liu, Dongqi Tang, Jiawei Ge, Weijia Liu, Bo Liu, Jiuxin Cao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11451 2024-01-02 cs.CV cs.RO 57%

Language-Assisted 3D Scene Understanding

Yanmin Wu, Qiankun Gao, Renrui Zhang, Jian Zhang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

Comments Technical report, unpublished, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.07366 2023-12-29 cs.CV 57%

TriCoLo: Trimodal Contrastive Loss for Text to Shape Retrieval

Yue Ruan, Han-Hung Lee, Yiming Zhang, Ke Zhang, Angel X. Chang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted by WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14630 2023-12-25 cs.CV 57%

A Language-based solution to enable Metaverse Retrieval

Ali Abdari, Alex Falcon, Giuseppe Serra

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted at 30th International Conference on Multimedia Modeling- MMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08154 2023-12-22 cs.CV cs.IR 57%

Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking

Wenzhang Wei, Zhipeng Gui, Changguang Wu, Anqi Zhao, Dehua Peng, Huayi Wu

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15136 2023-12-22 cs.CV 57%

3D Shape Knowledge Graph for Cross-domain 3D Shape Retrieval

Rihao Chang, Yongtao Ma, Tong Hao, Weizhi Nie

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏