Linear Alignment of Vision-language Models for Image Captioning
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 9 pages (+ references and appendix)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 9 pages (+ references and appendix)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 6 pages, 10 figures, conference, Artificial Intelligence
Journal ref in Color and Imaging Conference, 2024, pp 101 - 106
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted to NAACL 2025, main conference. 20 pages, 10 figures, 10 tables
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Our code is available at https://github.com/Alpha-Innovator/GeoX
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted at WACV, 2025
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by TMM 2024
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 27 pages, NeurIPS 2024
Journal ref NeurIPS 2024
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI、cs.MM
Comments 34 pages,11 figures
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 17 pages, 5 figures, 4 tables. 38th Conference on Neural Information Processing Systems (NeurIPS 2024)
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments NeurIPS 2024
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Published in the 3rd Workshop on New Frontiers in Adversarial Machine Learning at NeurIPS 2024. 10 pages, 7 figures, 3 tables
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments EMNLP 2024 Main
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at IJCAI 2024
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 9 pages
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 14 figures, 3 tables
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments ECCV 2024
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments ECCV2024; Codes and Supp. are available at: https://github.com/YBZh/LAPT
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 5 figures
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments A Survey on Vision-Language Pre-training
Journal ref Machine Intelligence Research. 20(1), February 2023, 38-56
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments CVPR2024 Accepted