arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4643 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4643 篇

2310.14581 2023-10-24 cs.CV cs.AI 81%

Leveraging Image-Text Similarity and Caption Modification for the DataComp Challenge: Filtering Track and BYOD Track

Shuhei Yokoo, Peifei Zhu, Yuchi Ishikawa, Mikihiro Tanaka, Masayoshi Kondo, Hirokatsu Kataoka

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at the ICCV 2023 Workshop on Towards the Next Generation of Computer Vision Datasets: DataComp Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11173 2023-10-18 cs.CV cs.AI 81%

Knowledge Extraction and Distillation from Large-Scale Image-Text Colonoscopy Records Leveraging Large Language and Vision Models

Shuo Wang, Yan Zhu, Xiaoyuan Luo, Zhiwei Yang, Yizhe Zhang, Peiyao Fu, Manning Wang, Zhijian Song, Quanlin Li, Pinghong Zhou, Yike Guo

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16705 2023-10-18 cs.CV cs.CL cs.LG 81%

Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning

David Noever, Samantha Elizabeth Miller Noever

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00653 2023-10-03 cs.CV cs.AI 81%

Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants

Tianyu Yu, Jinyi Hu, Yuan Yao, Haoye Zhang, Yue Zhao, Chongyi Wang, Shan Wang, Yinxv Pan, Jiao Xue, Dahai Li, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01544 2023-10-03 cs.CV cs.CL 81%

Multimodal Neurons in Pretrained Text-Only Transformers

Sarah Schwettmann, Neil Chowdhury, Samuel Klein, David Bau, Antonio Torralba

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Oral presentation at ICCV CLVL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13563 2023-09-28 cs.CV cs.AI 81%

Noise-aware Learning from Web-crawled Image-Text Data for Image Captioning

Wooyoung Kang, Jonghwan Mun, Sungjun Lee, Byungseok Roh

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10475 2023-09-14 cs.CL cs.CV 81%

Findings of Factify 2: Multimodal Fake News Detection

S Suryavardan, Shreyash Mishra, Megha Chakraborty, Parth Patwa, Anku Rani, Aman Chadha, Aishwarya Reganti, Amitava Das, Amit Sheth, Manoj Chinnakotla, Asif Ekbal, Srijan Kumar

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL

Comments Defactify2 @AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12305 2023-08-25 cs.LG cs.AI cs.MM 81%

FedDAT: An Approach for Foundation Model Finetuning in Multi-Modal Heterogeneous Federated Learning

Haokun Chen, Yao Zhang, Denis Krompass, Jindong Gu, Volker Tresp

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06494 2023-08-25 cs.CV cs.AI 81%

Multi-modal Pre-training for Medical Vision-language Understanding and Generation: An Empirical Study with A New Benchmark

Li Xu, Bo Liu, Ameer Hamza Khan, Lu Fan, Xiao-Ming Wu

专题命中 图文多模态 :multi-modal(title);image-text(abstract);分类 cs.CV、cs.AI

Comments Published as oral paper in CHIL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11797 2023-08-24 cs.CV cs.IR cs.MM 81%

CLIP Multi-modal Hashing: A new baseline CLIPMH

Jian Zhu, Mingkai Sheng, Mingda Ke, Zhangmin Huang, Jingfei Chang

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments submit to ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07933 2023-08-17 cs.CL cs.CV cs.LG 81%

Evaluating Picture Description Speech for Dementia Detection using Image-text Alignment

Youxiang Zhu, Nana Lin, Xiaohui Liang, John A. Batsis, Robert M. Roth, Brian MacWhinney

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04380 2023-08-09 cs.CV cs.IR cs.MM 81%

Your Negative May not Be True Negative: Boosting Image-Text Matching with False Negative Elimination

Haoxuan Li, Yi Bin, Junrong Liao, Yang Yang, Heng Tao Shen

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04118 2023-08-09 cs.CV cs.MM 81%

Multimodal Color Recommendation in Vector Graphic Documents

Qianru Qiu, Xueting Wang, Mayu Otani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12260 2023-05-26 cs.CV cs.CL 81%

Cross2StrA: Unpaired Cross-lingual Image Captioning with Cross-lingual Cross-modal Structure-pivoted Alignment

Shengqiong Wu, Hao Fei, Wei Ji, Tat-Seng Chua

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13273 2023-05-09 cs.CV cs.CL cs.LG 81%

From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping

Junyang Wang, Ming Yan, Yi Zhang, Jitao Sang

专题命中 图文多模态 :cross-modal(title);image-text(abstract);分类 cs.CV、cs.CL

Comments 11 pages, 15 figures, has been accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10766 2023-03-22 cs.CV cs.AI 81%

Multi-modal reward for visual relationships-based image captioning

Ali Abedi, Hossein Karshenas, Peyman Adibi

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01510 2023-03-06 cs.LG cs.AI cs.CL 81%

INO at Factify 2: Structure Coherence based Multi-Modal Fact Verification

Yinuo Zhang, Zhulin Tao, Xi Wang, Tongyue Wang

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments AAAI-23 DeFactify 2 Workshop (2nd Prize)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00181 2023-03-02 cs.CV cs.MM 81%

Selectively Hard Negative Mining for Alleviating Gradient Vanishing in Image-Text Matching

Zheng Li, Caili Guo, Xin Wang, Zerun Feng, Zhongtian Du

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.09667 2023-02-15 cs.CV cs.CL 81%

Video Captioning with Guidance of Multimodal Latent Topics

Shizhe Chen, Jia Chen, Qin Jin, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments ACM Multimedia 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.11109 2022-12-22 cs.CV cs.CL cs.LG 81%

MAViC: Multimodal Active Learning for Video Captioning

Gyanendra Das, Xavier Thomas, Anant Raj, Vikram Gupta

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07075 2022-12-15 cs.CV cs.CL 81%

Cross-Modal Similarity-Based Curriculum Learning for Image Captioning

Hongkuan Zhang, Saku Sugawara, Akiko Aizawa, Lei Zhou, Ryohei Sasano, Koichi Takeda

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16431 2022-11-01 cs.CV cs.CL 81%

DiMBERT: Learning Vision-Language Grounded Representations with Disentangled Multimodal-Attention

Fenglin Liu, Xian Wu, Shen Ge, Xuancheng Ren, Wei Fan, Xu Sun, Yuexian Zou

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Published in ACM TKDD2022 (ACM Transactions on Knowledge Discovery from Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15937 2022-10-31 cs.CL cs.SD eess.AS 81%

On the Use of Modality-Specific Large-Scale Pre-Trained Encoders for Multimodal Sentiment Analysis

Atsushi Ando, Ryo Masumura, Akihiko Takashima, Satoshi Suzuki, Naoki Makishima, Keita Suzuki, Takafumi Moriya, Takanori Ashihara, Hiroshi Sato

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted to SLT 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14823 2022-10-31 cs.CV cs.AI 81%

Visual Answer Localization with Cross-modal Mutual Knowledge Transfer

Yixuan Weng, Bin Li

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 4 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14712 2022-10-27 cs.CL cs.AI 81%

Bloom Library: Multimodal Datasets in 300+ Languages for a Variety of Downstream Tasks

Colin Leong, Joshua Nemecek, Jacob Mansdorfer, Anna Filighera, Abraham Owodunni, Daniel Whitenack

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 1 figure, 3 tables, accepted to and presented at EMNLP 2022

Journal ref EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.01744 2022-08-04 cs.CV cs.AI cs.LG 81%

Cross-Modal Alignment Learning of Vision-Language Conceptual Systems

Taehyeong Kim, Hyeonseop Song, Byoung-Tak Zhang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.04174 2022-07-12 cs.CV cs.AI 81%

Towards Multimodal Vision-Language Models Generating Non-Generic Text

Wes Robbins, Zanyar Zohourianshahzadi, Jugal Kalita

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref 2021 International Conference on Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11091 2022-06-23 cs.CL cs.AI 81%

Generalizing Multimodal Pre-training into Multilingual via Language Acquisition

Liang Zhang, Anwen Hu, Qin Jin

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04363 2022-06-09 cs.CV cs.AI cs.LG 81%

Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning

Chia-Wen Kuo, Zsolt Kira

专题命中 图文多模态 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments paper accepted in CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04347 2022-04-12 cs.CL cs.AI 81%

On the Importance of Karaka Framework in Multi-modal Grounding

Sai Kiran Gorthi, Radhika Mamidi

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏