arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2211.01427 2023-05-25 cs.CV cs.AI 62%

CLIP-Sculptor: Zero-Shot Generation of High-Fidelity and Diverse Shapes from Natural Language

Aditya Sanghi, Rao Fu, Vivian Liu, Karl Willis, Hooman Shayani, Amir Hosein Khasahmadi, Srinath Sridhar, Daniel Ritchie

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted at Conference on Computer Vision and Pattern Recognition 2023(CVPR2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01335 2023-05-24 cs.CV cs.CL 62%

Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese

An Yang, Junshu Pan, Junyang Lin, Rui Men, Yichang Zhang, Jingren Zhou, Chang Zhou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12144 2023-05-23 cs.CV cs.AI 62%

DiffCap: Exploring Continuous Diffusion on Image Captioning

Yufeng He, Zefan Cai, Xu Gan, Baobao Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03212 2023-05-19 cs.CV cs.AI 62%

LLM2Loss: Leveraging Language Models for Explainable Model Diagnostics

Shervin Ardeshir

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07796 2023-05-17 cs.CL cs.CV 62%

CREPE: Can Vision-Language Foundation Models Reason Compositionally?

Zixian Ma, Jerry Hong, Mustafa Omer Gul, Mona Gandhi, Irena Gao, Ranjay Krishna

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Updated figures and numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07836 2023-05-16 cs.CV cs.AI 62%

Masked Autoencoding Does Not Help Natural Language Supervision at Scale

Floris Weers, Vaishaal Shankar, Angelos Katharopoulos, Yinfei Yang, Tom Gunter

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07558 2023-05-15 cs.CL cs.CV 62%

Measuring Progress in Fine-grained Vision-and-Language Understanding

Emanuele Bugliarello, Laurent Sartran, Aishwarya Agrawal, Lisa Anne Hendricks, Aida Nematzadeh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06159 2023-05-11 cs.CL cs.AI 62%

A Review of Vision-Language Models and their Performance on the Hateful Memes Challenge

Bryan Zhao, Andrew Zhang, Blake Watson, Gillian Kearney, Isaac Dale

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05095 2023-05-10 cs.CV cs.AI 62%

Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness

Liangliang Cao, Bowen Zhang, Chen Chen, Yinfei Yang, Xianzhi Du, Wencong Zhang, Zhiyun Lu, Yantao Zheng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10091 2023-04-21 cs.CV cs.MM 62%

Learning CLIP Guided Visual-Text Fusion Transformer for Video-based Pedestrian Attribute Recognition

Jun Zhu, Jiandong Jin, Zihan Yang, Xiaohao Wu, Xiao Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR-2023 Workshop@NFVLR (New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03112 2023-04-18 cs.LG cs.CL cs.CV cs.RO 62%

A New Path: Scaling Vision-and-Language Navigation with Synthetic Instructions and Imitation Learning

Aishwarya Kamath, Peter Anderson, Su Wang, Jing Yu Koh, Alexander Ku, Austin Waters, Yinfei Yang, Jason Baldridge, Zarana Parekh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10050 2023-04-13 cs.LG cs.CL cs.CV 62%

Combined Scaling for Zero-shot Transfer Learning

Hieu Pham, Zihang Dai, Golnaz Ghiasi, Kenji Kawaguchi, Hanxiao Liu, Adams Wei Yu, Jiahui Yu, Yi-Ting Chen, Minh-Thang Luong, Yonghui Wu, Mingxing Tan, Quoc V. Le

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17376 2023-03-31 cs.CV cs.AI cs.LG 62%

A Study of Autoregressive Decoders for Multi-Tasking in Computer Vision

Lucas Beyer, Bo Wan, Gagan Madan, Filip Pavetic, Andreas Steiner, Alexander Kolesnikov, André Susano Pinto, Emanuele Bugliarello, Xiao Wang, Qihang Yu, Liang-Chieh Chen, Xiaohua Zhai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15180 2023-03-28 cs.CV cs.AI cs.CR 62%

Detecting Backdoors in Pre-trained Encoders

Shiwei Feng, Guanhong Tao, Siyuan Cheng, Guangyu Shen, Xiangzhe Xu, Yingqi Liu, Kaiyuan Zhang, Shiqing Ma, Xiangyu Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted at CVPR 2023. Code is available at https://github.com/GiantSeaweed/DECREE

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08013 2023-03-27 cs.CV cs.AI cs.LG 62%

FlexiViT: One Model for All Patch Sizes

Lucas Beyer, Pavel Izmailov, Alexander Kolesnikov, Mathilde Caron, Simon Kornblith, Xiaohua Zhai, Matthias Minderer, Michael Tschannen, Ibrahim Alabdulmohsin, Filip Pavetic

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Code and pre-trained models available at https://github.com/google-research/big_vision. All authors made significant technical contributions. CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13040 2023-03-24 cs.CV cs.AI 62%

Open-Vocabulary Object Detection using Pseudo Caption Labels

Han-Cheol Cho, Won Young Jhoo, Wooyoung Kang, Byungseok Roh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14563 2023-03-20 cs.CV cs.CL 62%

Who are you referring to? Coreference resolution in image narrations

Arushi Goel, Basura Fernando, Frank Keller, Hakan Bilen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07226 2023-03-14 cs.CV cs.CL 62%

Scaling Vision-Language Models with Sparse Mixture of Experts

Sheng Shen, Zhewei Yao, Chunyuan Li, Trevor Darrell, Kurt Keutzer, Yuxiong He

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15280 2023-03-14 cs.CV cs.AI 62%

Learning Transferable Spatiotemporal Representations from Natural Script Knowledge

Ziyun Zeng, Yuying Ge, Xihui Liu, Bin Chen, Ping Luo, Shu-Tao Xia, Yixiao Ge

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2023; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13069 2023-02-28 cs.CV cs.AI 62%

Medical visual question answering using joint self-supervised learning

Yuan Zhou, Jing Mei, Yiqin Yu, Tanveer Syeda-Mahmood

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08268 2023-02-17 cs.CV cs.CL 62%

Retrieval-augmented Image Captioning

Rita Ramos, Desmond Elliott, Bruno Martins

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Journal ref EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07688 2023-02-13 cs.CL cs.CV 62%

Plausible May Not Be Faithful: Probing Object Hallucination in Vision-Language Pre-training

Wenliang Dai, Zihan Liu, Ziwei Ji, Dan Su, Pascale Fung

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted at EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10939 2023-01-27 cs.CV cs.CL cs.LG 62%

Affective Faces for Goal-Driven Dyadic Communication

Scott Geng, Revant Teotia, Purva Tendulkar, Sachit Menon, Carl Vondrick

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16191 2023-01-23 cs.CV cs.MM 62%

SgVA-CLIP: Semantic-guided Visual Adapting of Vision-Language Models for Few-shot Image Classification

Fang Peng, Xiaoshan Yang, Linhui Xiao, Yaowei Wang, Changsheng Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.02241 2023-01-06 cs.CV cs.CL 62%

CiT: Curation in Training for Effective Vision-Language Data

Hu Xu, Saining Xie, Po-Yao Huang, Licheng Yu, Russell Howes, Gargi Ghosh, Luke Zettlemoyer, Christoph Feichtenhofer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01224 2023-01-04 cs.SE cs.AI cs.CV cs.LG 62%

An Empirical Investigation into the Use of Image Captioning for Automated Software Documentation

Kevin Moran, Ali Yachnes, George Purnell, Junayed Mahmud, Michele Tufano, Carlos Bernal-Cárdenas, Denys Poshyvanyk, Zach H'Doubler

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published in the Proceedings of the 29th IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER'22), Honolulu, Hawaii, March 15-18, 2022, pp. 514-525

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.11270 2022-12-22 cs.CV cs.CL 62%

Generalized Decoding for Pixel, Image, and Language

Xueyan Zou, Zi-Yi Dou, Jianwei Yang, Zhe Gan, Linjie Li, Chunyuan Li, Xiyang Dai, Harkirat Behl, Jianfeng Wang, Lu Yuan, Nanyun Peng, Lijuan Wang, Yong Jae Lee, Jianfeng Gao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments https://x-decoder-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02184 2022-12-06 cs.CV cs.AI 62%

3D-LatentMapper: View Agnostic Single-View Reconstruction of 3D Shapes

Alara Dirik, Pinar Yanardag

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS - WiML workshop 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03482 2022-11-30 cs.CV cs.AI 62%

Bridging the Gap between Object and Image-level Representations for Open-Vocabulary Detection

Hanoona Rasheed, Muhammad Maaz, Muhammad Uzair Khattak, Salman Khan, Fahad Shahbaz Khan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13445 2022-11-28 cs.CV cs.AI cs.LG 62%

Delving into Out-of-Distribution Detection with Vision-Language Representations

Yifei Ming, Ziyang Cai, Jiuxiang Gu, Yiyou Sun, Wei Li, Yixuan Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 36th Conference on Neural Information Processing Systems (NeurIPS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏