arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2308.10253 2023-12-29 cs.CV cs.CL cs.LG 62%

StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data

Yanda Li, Chi Zhang, Gang Yu, Zhibin Wang, Bin Fu, Guosheng Lin, Chunhua Shen, Ling Chen, Yunchao Wei

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://github.com/icoz69/StableLLAVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10045 2023-12-22 cs.CV cs.CL 62%

An Empirical Study of CLIP for Text-based Person Search

Min Cao, Yang Bai, Ziyin Zeng, Mang Ye, Min Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by AAAI 2024. Code is available at https://github.com/Flame-Chasers/TBPS-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12458 2023-12-21 cs.CL cs.AI 62%

When Parameter-efficient Tuning Meets General-purpose Vision-language Models

Yihang Zhai, Haixin Wang, Jianlong Chang, Xinlong Yang, Jinan Sun, Shikun Zhang, Qi Tian

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07221 2023-12-13 cs.CV cs.AI 62%

Transferring CLIP's Knowledge into Zero-Shot Point Cloud Semantic Segmentation

Yuanbin Wang, Shaofei Huang, Yulu Gao, Zhen Wang, Rui Wang, Kehua Sheng, Bo Zhang, Si Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00910 2023-12-13 cs.CV cs.AI 62%

CoPL: Contextual Prompt Learning for Vision-Language Understanding

Koustava Goswami, Srikrishna Karanam, Prateksha Udhayanan, K J Joseph, Balaji Vasan Srinivasan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02924 2023-12-11 cs.CV cs.AI 62%

Interpretable Visual Understanding with Cognitive Attention Network

Xuejiao Tang, Wenbin Zhang, Yi Yu, Kea Turner, Tyler Derr, Mengyu Wang, Eirini Ntoutsi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments ICANN21

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02191 2023-12-06 cs.CV cs.AI 62%

Prompt Tuning for Zero-shot Compositional Learning

Lingyu Zhang, Ting Hua, Yilin Shen, Hongxia Jin

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01656 2023-12-06 cs.IR cs.AI cs.CV cs.HC 62%

The Contemporary Art of Image Search: Iterative User Intent Expansion via Vision-Language Model

Yilin Ye, Qian Zhu, Shishi Xiao, Kang Zhang, Wei Zeng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by The 2024 ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW) (Proc. CSCW 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18592 2023-12-01 cs.CV cs.AI 62%

Semantic-Aware Frame-Event Fusion based Pattern Recognition via Large Vision-Language Models

Dong Li, Jiandong Jin, Yuhao Zhang, Yanlin Zhong, Yaoyang Wu, Lan Chen, Xiao Wang, Bin Luo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08172 2023-11-28 cs.MM cs.CV 62%

Vision-Language Instruction Tuning: A Review and Analysis

Chen Li, Yixiao Ge, Dian Li, Ying Shan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02080 2023-11-21 cs.CV cs.CL cs.LG 62%

Benchmarking Robustness of Adaptation Methods on Pre-trained Vision-Language Models

Shuo Chen, Jindong Gu, Zhen Han, Yunpu Ma, Philip Torr, Volker Tresp

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track; 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01361 2023-11-03 cs.CV cs.CL 62%

GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks

Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan, Jun Yan, Lianke Qin, Heng Wang, Xifeng Yan, William Yang Wang, Linda Ruth Petzold

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00206 2023-11-02 cs.CV cs.AI 62%

ChatGPT-Powered Hierarchical Comparisons for Image Classification

Zhiyuan Ren, Yiyang Su, Xiaoming Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Neurips 2023 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14897 2023-10-31 cs.CL cs.CV cs.LG 62%

Text encoders bottleneck compositionality in contrastive vision-language models

Amita Kamath, Jack Hessel, Kai-Wei Chang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15325 2023-10-25 cs.CV cs.CL cs.LG 62%

LXMERT Model Compression for Visual Question Answering

Maryam Hashemi, Ghazaleh Mahmoudi, Sara Kodeiri, Hadi Sheikhi, Sauleh Eetemadi

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15166 2023-10-24 cs.CV cs.CL 62%

Large Language Models are Visual Reasoning Coordinators

Liangyu Chen, Bo Li, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14108 2023-10-24 cs.LG cs.AI cs.CV 62%

CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement

Mohammadreza Salehi, Mehrdad Farajtabar, Maxwell Horton, Fartash Faghri, Hadi Pouransari, Raviteja Vemulapalli, Oncel Tuzel, Ali Farhadi, Mohammad Rastegari, Sachin Mehta

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05065 2023-10-18 cs.CV cs.AI 62%

Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks

Xinsong Zhang, Yan Zeng, Jipeng Zhang, Hang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09929 2023-10-17 cs.CV cs.CL 62%

Prompting Scientific Names for Zero-Shot Species Recognition

Shubham Parashar, Zhiqiu Lin, Yanan Li, Shu Kong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12966 2023-10-16 cs.CV cs.CL 62%

Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, Jingren Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Code, demo and models are available at https://github.com/QwenLM/Qwen-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02988 2023-10-05 cs.CV cs.AI 62%

Probing Intersectional Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Vasudev Lal

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02804 2023-10-05 cs.CL cs.CV cs.LG 62%

DOMINO: A Dual-System for Multi-step Visual Language Reasoning

Peifang Wang, Olga Golovneva, Armen Aghajanyan, Xiang Ren, Muhao Chen, Asli Celikyilmaz, Maryam Fazel-Zarandi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00398 2023-10-02 cs.CV cs.AI cs.LG 62%

ProbVLM: Probabilistic Adapter for Frozen Vision-Language Models

Uddeshya Upadhyay, Shyamgopal Karthik, Massimiliano Mancini, Zeynep Akata

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15343 2023-09-28 cs.CV cs.AI 62%

Sigmoid Loss for Language Image Pre-Training

Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, Lucas Beyer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments ICCV'23 Oral. arXiv v2: fix typo in pseudocode; v3: clarify t vs t' init; v4: add SigLIP Base, Large, Shape-Optimized 400M results. Models released at: https://github.com/google-research/big_vision. Xiaohua and Lucas contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14381 2023-09-27 cs.CL cs.AI 62%

Survey of Social Bias in Vision-Language Models

Nayeon Lee, Yejin Bang, Holy Lovenia, Samuel Cahyawijaya, Wenliang Dai, Pascale Fung

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11510 2023-09-22 cs.IR cs.AI cs.CV 62%

When is a Foundation Model a Foundation Model

Saghir Alfasly, Peyman Nejat, Sobhan Hemati, Jibran Khan, Isaiah Lahr, Areej Alsaafin, Abubakr Shafique, Nneka Comfere, Dennis Murphree, Chady Meroueh, Saba Yasir, Aaron Mangold, Lisa Boardman, Vijay Shah, Joaquin J. Garcia, H. R. Tizhoosh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10361 2023-09-20 cs.CV cs.LG cs.MM 62%

Improving CLIP Robustness with Knowledge Distillation and Self-Training

Clement Laroudie, Andrei Bursuc, Mai Lan Ha, Gianni Franchi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03884 2023-09-08 cs.SD cs.CL eess.AS 62%

Zero-Shot Audio Captioning via Audibility Guidance

Tal Shaharabany, Ariel Shaulov, Lior Wolf

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03340 2023-09-08 cs.CL cs.MM cs.SD 62%

Parameter Efficient Audio Captioning With Faithful Guidance Using Audio-text Shared Latent Representation

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser, Rehana Mahfuz

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM

Comments 5 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01617 2023-09-06 cs.CV cs.AI cs.LG 62%

DeViL: Decoding Vision features into Language

Meghal Dani, Isabel Rio-Torto, Stephan Alaniz, Zeynep Akata

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted at GCPR 2023 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏