arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2209.13869 2022-11-08 cs.CV cs.MM 62%

Unified Loss of Pair Similarity Optimization for Vision-Language Retrieval

Zheng Li, Caili Guo, Xin Wang, Zerun Feng, Jenq-Neng Hwang, Zhongtian Du

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.MM

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11817 2022-11-07 cs.CL cs.AI 62%

Translation between Molecules and Natural Language

Carl Edwards, Tuan Lai, Kevin Ros, Garrett Honke, Kyunghyun Cho, Heng Ji

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2022. Data and code can be found on [Github](https://github.com/blender-nlp/MolT5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11277 2022-11-04 cs.CV cs.AI 62%

TANGO: Text-driven Photorealistic and Robust 3D Stylization via Lighting Decomposition

Yongwei Chen, Rui Chen, Jiabao Lei, Yabin Zhang, Kui Jia

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16742 2022-11-01 cs.CV cs.AI cs.LG 62%

On-the-fly Object Detection using StyleGAN with CLIP Guidance

Yuzhe Lu, Shusen Liu, Jayaraman J. Thiagarajan, Wesam Sakla, Rushil Anirudh

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14161 2022-10-26 cs.CV cs.AI 62%

Aligning MAGMA by Few-Shot Learning and Finetuning

Jean-Charles Layoun, Alexis Roger, Irina Rish

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by the Montreal AI Symposium conference in 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11686 2022-10-25 cs.CL cs.CV 62%

On Advances in Text Generation from Images Beyond Captioning: A Case Study in Self-Rationalization

Shruti Palaskar, Akshita Bhagia, Yonatan Bisk, Florian Metze, Alan W Black, Ana Marasović

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments v2: EMNLP Findings 2022 accepted paper camera-ready version. 9 pages main, 2 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08723 2022-10-18 cs.CL cs.CV 62%

Distilled Dual-Encoder Model for Vision-Language Understanding

Zekun Wang, Wenhui Wang, Haichao Zhu, Ming Liu, Bing Qin, Furu Wei

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07795 2022-10-17 cs.CL cs.CV 62%

EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning

Tiannan Wang, Wangchunshu Zhou, Yan Zeng, Xinsong Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.02312 2022-08-16 cs.CL cs.CV cs.HC 62%

A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility

Andrea Burns, Deniz Arsan, Sanjna Agrawal, Ranjitha Kumar, Kate Saenko, Bryan A. Plummer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at the European Conference on Computer Vision (ECCV) 2022. This is a new version of the paper with additional experimental results and a few prior implementation bugs fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10936 2022-07-19 cs.CV cs.CL cs.LG 62%

A Survey of Vision-Language Pre-Trained Models

Yifan Du, Zikang Liu, Junyi Li, Wayne Xin Zhao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted by IJCAI-2022 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09331 2022-07-19 cs.CV cs.MM 62%

Contrastive Vision-Language Pre-training with Limited Resources

Quan Cui, Boyan Zhou, Yu Guo, Weidong Yin, Hao Wu, Osamu Yoshie, Yubo Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted to ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03354 2022-06-10 cs.CL cs.CV 62%

cViL: Cross-Lingual Training of Vision-Language Models using Knowledge Distillation

Kshitij Gupta, Devansh Gautam, Radhika Mamidi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted at ICPR 2022; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.02358 2022-05-30 cs.CV cs.CL cs.LG 62%

VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts

Hangbo Bao, Wenhui Wang, Li Dong, Qiang Liu, Owais Khan Mohammed, Kriti Aggarwal, Subhojit Som, Furu Wei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11797 2022-05-23 cs.CV cs.CL 62%

CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models

Yuan Yao, Ao Zhang, Zhengyan Zhang, Zhiyuan Liu, Tat-Seng Chua, Maosong Sun

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12723 2022-04-15 cs.CV cs.CL 62%

A Frustratingly Simple Approach for End-to-End Image Captioning

Ziyang Luo, Yadong Xi, Rongsheng Zhang, Jing Ma

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15526 2022-04-13 cs.SD cs.CL eess.AS 62%

Interactive Audio-text Representation for Automated Audio Captioning with Contrastive Learning

Chen Chen, Nana Hou, Yuchen Hu, Heqing Zou, Xiaofeng Qi, Eng Siong Chng

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments Submitted to Interspeech 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02174 2022-04-06 cs.CV cs.CL 62%

Multi-View Transformer for 3D Visual Grounding

Shijia Huang, Yilun Chen, Jiaya Jia, Liwei Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments cvpr2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12233 2022-03-29 cs.CV cs.CL 62%

Scaling Up Vision-Language Pre-training for Image Captioning

Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, Lijuan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01518 2022-03-22 cs.CV cs.AI cs.LG 62%

DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting

Yongming Rao, Wenliang Zhao, Guangyi Chen, Yansong Tang, Zheng Zhu, Guan Huang, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR2022. Project page: https://denseclip.ivg-research.xyz

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.02387 2022-03-21 cs.CV cs.CL cs.LG 62%

An Empirical Study of Training End-to-End Vision-and-Language Transformers

Zi-Yi Dou, Yichong Xu, Zhe Gan, Jianfeng Wang, Shuohang Wang, Lijuan Wang, Chenguang Zhu, Pengchuan Zhang, Lu Yuan, Nanyun Peng, Zicheng Liu, Michael Zeng

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09067 2022-03-18 cs.CV cs.CL 62%

UNIMO-2: End-to-End Unified Vision-Language Grounded Learning

Wei Li, Can Gao, Guocheng Niu, Xinyan Xiao, Hao Liu, Jiachen Liu, Hua Wu, Haifeng Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ACL2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05321 2022-03-14 cs.CV cs.CL 62%

StyleBabel: Artistic Style Tagging and Captioning

Dan Ruta, Andrew Gilbert, Pranav Aggarwal, Naveen Marri, Ajinkya Kale, Jo Briggs, Chris Speed, Hailin Jin, Baldo Faieta, Alex Filipkowski, Zhe Lin, John Collomosse

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03133 2022-03-02 cs.CV cs.CL 62%

StyleCLIPDraw: Coupling Content and Style in Text-to-Drawing Synthesis

Peter Schaldenbrand, Zhixuan Liu, Jean Oh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Superseded by arXiv:2202.12362

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.15283 2022-01-03 cs.CV cs.CL 62%

ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation

Han Zhang, Weichong Yin, Yewei Fang, Lanxin Li, Boqiang Duan, Zhihua Wu, Yu Sun, Hao Tian, Hua Wu, Haifeng Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11832 2021-12-16 cs.CV cs.CL cs.LG 62%

Playing Lottery Tickets with Vision and Language

Zhe Gan, Yen-Chun Chen, Linjie Li, Tianlong Chen, Yu Cheng, Shuohang Wang, Jingjing Liu, Lijuan Wang, Zicheng Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments Accepted to AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02413 2021-12-07 cs.CV cs.AI cs.RO 62%

PointCLIP: Point Cloud Understanding by CLIP

Renrui Zhang, Ziyu Guo, Wei Zhang, Kunchang Li, Xupeng Miao, Bin Cui, Yu Qiao, Peng Gao, Hongsheng Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Open sourced, Code and Model Available

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06912 2021-12-02 cs.CV cs.CL 62%

From Show to Tell: A Survey on Deep Learning-based Image Captioning

Matteo Stefanini, Marcella Cornia, Lorenzo Baraldi, Silvia Cascianelli, Giuseppe Fiameni, Rita Cucchiara

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09990 2021-11-23 eess.AS cs.AI cs.SD 62%

CL4AC: A Contrastive Loss for Audio Captioning

Xubo Liu, Qiushi Huang, Xinhao Mei, Tom Ko, H Lilian Tang, Mark D. Plumbley, Wenwu Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

Comments The first two authors contributed equally, 5 pages, 3 figures, accepted by DCASE2021 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03930 2021-11-16 cs.CV cs.CL 62%

Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling

Renrui Zhang, Rongyao Fang, Wei Zhang, Peng Gao, Kunchang Li, Jifeng Dai, Yu Qiao, Hongsheng Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02339 2021-11-12 cs.CV cs.CL 62%

Understanding Guided Image Captioning Performance across Domains

Edwin G. Ng, Bo Pang, Piyush Sharma, Radu Soricut

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Proceedings of CoNLL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏