arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3450 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3450 篇

2110.02577 2021-10-07 cs.CL cs.CV 81%

Efficient Multi-Modal Embeddings from Structured Data

Anita L. Verő, Ann Copestake

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments 5 pages, 5 pages of appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.03955 2021-09-22 cs.CV cs.MM 81%

Cross-Modal Food Retrieval: Learning a Joint Embedding of Food Images and Recipes with Semantic Consistency and Attention Mechanism

Hao Wang, Doyen Sahoo, Chenghao Liu, Ke Shu, Palakorn Achananuparp, Ee-peng Lim, Steven C. H. Hoi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04556 2021-09-10 cs.CL cs.AI cs.PL 81%

SynCoBERT: Syntax-Guided Multi-Modal Contrastive Pre-Training for Code Representation

Xin Wang, Yasheng Wang, Fei Mi, Pingyi Zhou, Yao Wan, Xiao Liu, Li Li, Hao Wu, Jin Liu, Xin Jiang

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.04980 2021-08-26 cs.CV cs.CL 81%

Telling the What while Pointing to the Where: Multimodal Queries for Image Retrieval

Soravit Changpinyo, Jordi Pont-Tuset, Vittorio Ferrari, Radu Soricut

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments IEEE/CVF International Conference on Computer Vision (ICCV 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.00705 2021-08-10 cs.CV cs.MM 81%

Efficient Deep Feature Calibration for Cross-Modal Joint Embedding Learning

Zhongwei Xie, Ling Liu, Lin Li, Luo Zhong

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments accepted by ACM ICMI 2021 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.08871 2021-07-01 cs.CV cs.AI 81%

I Want This Product but Different : Multimodal Retrieval with Synthetic Query Expansion

Ivona Tautkute, Tomasz Trzcinski

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Major edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.12139 2021-06-24 cs.CV cs.AI 81%

PatentNet: A Large-Scale Incomplete Multiview, Multimodal, Multilabel Industrial Goods Image Database

Fangyuan Lei, Da Huang, Jianjian Jiang, Ruijun Ma, Senhong Wang, Jiangzhong Cao, Yusen Lin, Qingyun Dai

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04939 2021-06-10 cs.CL cs.AI cs.LG 81%

Phraseformer: Multimodal Key-phrase Extraction using Transformer and Graph Embedding

Narjes Nikzad-Khasmakhi, Mohammad-Reza Feizi-Derakhshi, Meysam Asgari-Chenaghlu, Mohammad-Ali Balafar, Ali-Reza Feizi-Derakhshi, Taymaz Rahkar-Farshi, Majid Ramezani, Zoleikha Jahanbakhsh-Nagadeh, Elnaz Zafarani-Moattar, Mehrdad Ranjbar-Khadivi

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.03451 2021-05-19 cs.CV cs.IR cs.MM 81%

Deep Cross-modal Hashing via Margin-dynamic-softmax Loss

Rong-Cheng Tu, Xian-Ling Mao, Rongxin Tu, Binbin Bian, Wei Wei, Heyan Huang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02635 2021-04-02 cs.CL cs.CV 81%

M3P: Learning Universal Representations via Multitask Multilingual Multimodal Pre-training

Minheng Ni, Haoyang Huang, Lin Su, Edward Cui, Taroon Bharti, Lijuan Wang, Jianfeng Gao, Dongdong Zhang, Nan Duan

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted to CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15686 2021-03-30 cs.CV cs.MM 81%

Memory Enhanced Embedding Learning for Cross-Modal Video-Text Retrieval

Rui Zhao, Kecheng Zheng, Zheng-Jun Zha, Hongtao Xie, Jiebo Luo

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06032 2021-03-11 cs.CV cs.MM 81%

Cross-modal Image Retrieval with Deep Mutual Information Maximization

Chunbin Gu, Jiajun Bu, Xixi Zhou, Chengwei Yao, Dongfang Ma, Zhi Yu, Xifeng Yan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments 35 pages,7 figures, Submitted to Neuralcomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.00529 2021-02-02 cs.CL cs.CV 81%

Decoupling the Role of Data, Attention, and Losses in Multimodal Transformers

Lisa Anne Hendricks, John Mellor, Rosalia Schneider, Jean-Baptiste Alayrac, Aida Nematzadeh

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments pre-print of MIT Press Publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.14758 2021-01-01 cs.CV cs.AI cs.IT math.IT 81%

Deep Hashing for Secure Multimodal Biometrics

Veeru Talreja, Matthew Valenti, Nasser Nasrabadi

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref IEEE Transactions on Information Forensics and Security,vol.16,pp.1306-1321,2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.07658 2020-11-17 cs.CV cs.CL 81%

Deep multi-modal networks for book genre classification based on its cover

Chandra Kundu, Lukun Zheng

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.08200 2020-10-19 cs.CL cs.AI 81%

Unsupervised Natural Language Inference via Decoupled Multimodal Contrastive Learning

Wanyun Cui, Guangyu Zheng, Wei Wang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Published at EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01095 2020-04-03 cs.CV cs.CL 81%

MCEN: Bridging Cross-Modal Gap between Cooking Recipes and Dish Images with Latent Variable Model

Han Fu, Rui Wu, Chenghao Liu, Jianling Sun

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted to CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.01273 2020-03-10 cs.CV cs.MM 81%

Learning Cross-Modal Embeddings with Adversarial Networks for Cooking Recipes and Food Images

Hao Wang, Doyen Sahoo, Chenghao Liu, Ee-peng Lim, Steven C. H. Hoi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07923 2020-01-01 cs.CV cs.MM 81%

Cluster-wise Unsupervised Hashing for Cross-Modal Similarity Search

Lu Wang, Jie Yang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments 13 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.03493 2020-01-01 cs.CV cs.CL 81%

MULE: Multimodal Universal Language Embedding

Donghyun Kim, Kuniaki Saito, Kate Saenko, Stan Sclaroff, Bryan A. Plummer

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted as an oral at AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.00058 2019-10-02 cs.CL cs.CV 81%

Multi-Head Attention with Diversity for Learning Grounded Multilingual Multimodal Representations

Po-Yao Huang, Xiaojun Chang, Alexander Hauptmann

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted at EMNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01341 2018-09-11 cs.AI cs.CL stat.ML 81%

Embedding Multimodal Relational Data for Knowledge Base Completion

Pouya Pezeshkpour, Liyan Chen, Sameer Singh

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Published at EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.07616 2018-06-05 stat.ML cs.CL cs.CV cs.LG 81%

Do Neural Network Cross-Modal Mappings Really Bridge Modalities?

Guillem Collell, Marie-Francine Moens

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments To appear at ACL 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.11146 2018-05-01 cs.CL cs.CV cs.IR 81%

Cross-Modal Retrieval in the Cooking Context: Learning Semantic Text-Image Embeddings

Micael Carvalho, Rémi Cadène, David Picard, Laure Soulier, Nicolas Thome, Matthieu Cord

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments accepted at the 41st International ACM SIGIR Conference on Research and Development in Information Retrieval, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04308 2017-08-16 cs.MM cs.CV cs.LG 81%

MHTN: Modal-adversarial Hybrid Transfer Network for Cross-modal Retrieval

Xin Huang, Yuxin Peng, Mingkuan Yuan

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments 12 pages, submitted to IEEE Transactions on Cybernetics

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09872 2017-08-10 cs.CV cs.CL cs.NE 81%

Full-Network Embedding in a Multimodal Embedding Pipeline

Armand Vilalta, Dario Garcia-Gasulla, Ferran Parés, Eduard Ayguadé, Jesus Labarta, Ulises Cortés, Toyotaro Suzumura

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments In 2nd Workshop on Semantic Deep Learning (SemDeep-2) at the 12th International Conference on Computational Semantics (IWCS) 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.03406 2017-03-07 cs.IR cs.CV cs.MM 81%

Multi-modal image retrieval with random walk on multi-layer graphs

Renata Khasanova, Xiaowen Dong, Pascal Frossard

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.09003 2016-10-31 cs.CV cs.LG cs.MM 81%

Cross-Modal Scene Networks

Yusuf Aytar, Lluis Castrejon, Carl Vondrick, Hamed Pirsiavash, Antonio Torralba

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

Comments See more at http://cmplaces.csail.mit.edu/. arXiv admin note: text overlap with arXiv:1607.07295

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.09188 2016-03-31 cs.CL cs.CV 81%

Unsupervised Visual Sense Disambiguation for Verbs using Multimodal Embeddings

Spandana Gella, Mirella Lapata, Frank Keller

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 11 pages, NAACL-HLT 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1504.06063 2015-09-01 cs.CV cs.CL cs.NE 81%

Multimodal Convolutional Neural Networks for Matching Image and Sentence

Lin Ma, Zhengdong Lu, Lifeng Shang, Hang Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by ICCV 2015

详情

展开后加载摘要…

URL PDF HTML 收藏