arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4644 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4644 篇

2204.03610 2022-04-08 cs.CV cs.AI cs.LG 81%

Unified Contrastive Learning in Image-Text-Label Space

Jianwei Yang, Chunyuan Li, Pengchuan Zhang, Bin Xiao, Ce Liu, Lu Yuan, Jianfeng Gao

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06683 2022-03-21 cs.CL cs.AI cs.LG 81%

Assessing Multilingual Fairness in Pre-trained Multimodal Representations

Jialu Wang, Yang Liu, Xin Eric Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05349 2022-03-11 cs.MM cs.CV 81%

Two-stream Hierarchical Similarity Reasoning for Image-text Matching

Ran Chen, Hanli Wang, Lei Wang, Sam Kwong

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.06558 2022-03-07 cs.CV cs.AI 81%

MAGIC: Multimodal relAtional Graph adversarIal inferenCe for Diverse and Unpaired Text-based Image Captioning

Wenqiao Zhang, Haochen Shi, Jiannan Guo, Shengyu Zhang, Qingpeng Cai, Juncheng Li, Sihui Luo, Yueting Zhuang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.11431 2021-11-23 cs.CV cs.CL 81%

RedCaps: web-curated image-text data created by the people, for the people

Karan Desai, Gaurav Kaul, Zubin Aysola, Justin Johnson

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2021 Datasets and Benchmarks. Website: https://redcaps.xyz

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03349 2021-11-08 cs.CV cs.CL cs.IR 81%

Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval

Zhihao Fan, Zhongyu Wei, Zejun Li, Siyuan Wang, Jianqing Fan

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11767 2021-10-29 cs.CV cs.AI 81%

Exploiting Cross-Modal Prediction and Relation Consistency for Semi-Supervised Image Captioning

Yang Yang, Hongchen Wei, Hengshu Zhu, Dianhai Yu, Hui Xiong, Jian Yang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02623 2021-10-07 cs.CV cs.AI 81%

Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching

Ali Furkan Biten, Andres Mafla, Lluis Gomez, Dimosthenis Karatzas

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments Accepted WACV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10559 2021-09-23 cs.CV cs.AI 81%

Hierarchical Multimodal Transformer to Summarize Videos

Bin Zhao, Maoguo Gong, Xuelong Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.08849 2021-04-16 cs.CV cs.CL 81%

Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer of Vision-Language Models

Po-Yao Huang, Mandela Patrick, Junjie Hu, Graham Neubig, Florian Metze, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments accepted by NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.08981 2021-03-31 cs.CV cs.CL 81%

Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts

Soravit Changpinyo, Piyush Sharma, Nan Ding, Radu Soricut

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2021). Our dataset is available at https://github.com/google-research-datasets/conceptual-12m

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03662 2021-03-23 cs.CV cs.CL 81%

Confidence-aware Non-repetitive Multimodal Transformers for TextCaps

Zhaokai Wang, Renda Bao, Qi Wu, Si Liu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 9 pages; Accepted by AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10480 2021-03-22 cs.LG cs.CL cs.CV 81%

Reading Isn't Believing: Adversarial Attacks On Multi-Modal Neurons

David A. Noever, Samantha E. Miller Noever

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.01368 2021-01-06 cs.CV cs.MM 81%

Similarity Reasoning and Filtration for Image-Text Matching

Haiwen Diao, Ying Zhang, Lin Ma, Huchuan Lu

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

Comments 14 pages, 8 figures, Accepted by AAAI2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12870 2020-12-08 cs.CV cs.AI 81%

Multimodal Learning for Hateful Memes Detection

Yi Zhou, Zhenhao Chen

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11760 2020-11-25 cs.CV cs.CL cs.LG 81%

Multimodal Pretraining for Dense Video Captioning

Gabriel Huang, Bo Pang, Zhenhai Zhu, Clara Rivera, Radu Soricut

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments AACL-IJCNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.03119 2020-05-08 cs.CL cs.CV 81%

Unsupervised Multimodal Neural Machine Translation with Pseudo Visual Pivoting

Po-Yao Huang, Junjie Hu, Xiaojun Chang, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00390 2020-04-02 cs.CV cs.CL 81%

More Grounded Image Captioning by Distilling Image-Text Matching Model

Yuanen Zhou, Meng Wang, Daqing Liu, Zhenzhen Hu, Hanwang Zhang

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06745 2020-03-17 cs.CV cs.CL 81%

Vision-Dialog Navigation by Exploring Cross-modal Memory

Yi Zhu, Fengda Zhu, Zhaohuan Zhan, Bingqian Lin, Jianbin Jiao, Xiaojun Chang, Xiaodan Liang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments CVPR2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.12585 2020-03-17 cs.CV cs.CL cs.LG 81%

Exploring and Distilling Cross-Modal Information for Image Captioning

Fenglin Liu, Xuancheng Ren, Yuanxin Liu, Kai Lei, Xu Sun

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by IJCAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.08622 2020-01-09 cs.CV cs.CL cs.LG stat.ML 81%

Variational Hetero-Encoder Randomized GANs for Joint Image-Text Modeling

Hao Zhang, Bo Chen, Long Tian, Zhengjue Wang, Mingyuan Zhou

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.00212 2019-11-04 cs.LG cs.CL cs.CV stat.ML 81%

Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning

Tao Jin, Siyu Huang, Yingming Li, Zhongfei Zhang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted as a long paper at EMNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09953 2019-09-27 cs.CV cs.AI 81%

Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators

Kuang-Huei Lee, Hamid Palangi, Xi Chen, Houdong Hu, Jianfeng Gao

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13358 2019-06-03 cs.CL cs.CV 81%

Multi-modal Discriminative Model for Vision-and-Language Navigation

Haoshuo Huang, Vihan Jain, Harsh Mehta, Jason Baldridge, Eugene Ie

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted at SpLU-RoboNLP 2019 (workshop at NAACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12980 2019-05-31 cs.CV cs.CL 81%

Interactive-predictive neural multimodal systems

Álvaro Peris, Francisco Casacuberta

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments To appear at IbPRIA 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.08024 2018-07-24 cs.CV cs.AI cs.LG 81%

Stacked Cross Attention for Image-Text Matching

Kuang-Huei Lee, Xi Chen, Gang Hua, Houdong Hu, Xiaodong He

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.06786 2018-05-25 cs.CL cs.CV cs.IR 81%

Quantifying the visual concreteness of words and topics in multimodal datasets

Jack Hessel, David Mimno, Lillian Lee

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments NAACL HLT 2018, 14 pages, 6 figures, data available at http://www.cs.cornell.edu/~jhessel/concreteness/concreteness.html

Journal ref 2018 North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL HLT)

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.05038 2017-09-18 cs.CV cs.CL cs.LG 81%

Self-Guiding Multimodal LSTM - when we do not have a perfect training dataset for image captioning

Yang Xian, Yingli Tian

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments The paper is under consideration at Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.07601 2017-07-25 cs.CL cs.CV 81%

Image Pivoting for Learning Multilingual Multimodal Representations

Spandana Gella, Rico Sennrich, Frank Keller, Mirella Lapata

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 7 pages, EMNLP 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.6632 2015-06-12 cs.CV cs.CL cs.LG 81%

Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)

Junhua Mao, Wei Xu, Yi Yang, Jiang Wang, Zhiheng Huang, Alan Yuille

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Add a simple strategy to boost the performance of image captioning task significantly. More details are shown in Section 8 of the paper. The code and related data are available at https://github.com/mjhucla/mRNN-CR ;. arXiv admin note: substantial text overlap with arXiv:1410.1090

Journal ref ICLR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏