Semi-Supervised Image Captioning Considering Wasserstein Graph Matching
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 10 pages,8 figures
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted on AAAI2024
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 7 figures
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments Code and models are available at https://github.com/InternLM/InternLM-XComposer
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 4 figures
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM
Comments Published in TMLR 2023
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted at ICCV 2023. Project page: https://mshukor.github.io/eP-ALM.github.io/
专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments ICCV 2023
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Camera-ready for 23, ACM MM
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 25 pages
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments ICLR 2023 (Notable-top-5%)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 17 pages; Website: https://aka.ms/llava-med
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2023
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments ICLR 2023
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments AKBC 2022
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 17 pages, 4 figures, 7 tables. For code and trained token embeddings, see https://github.com/oxai/debias-vision-lang; Changed to use ACL layout, added joint training with comparison figure, corrected spelling and formatting errors; This paper is accepted for publication at AACL 2022, the official version of record is in the ACL Anthology
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments To appear at EMNLP 2022
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments A survey paper/book on Vision-Language Pre-training (102 pages)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Under review. 25 pages with 4 figures
Journal ref Expert Systems with Applications, Volume 212, 2023, 118669
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 21 pages, 5 figures, 5 tables; (v2 adds some experimental details)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments WASSA 2022 at ACL 2022, published at https://aclanthology.org/2022.wassa-1.1/ Please cite using https://aclanthology.org/2022.wassa-1.1.bib
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments CVPR 2022