StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Project page: https://github.com/icoz69/StableLLAVA
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Project page: https://github.com/icoz69/StableLLAVA
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by AAAI 2024. Code is available at https://github.com/Flame-Chasers/TBPS-CLIP
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted at AAAI 2024
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments ICANN21
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by The 2024 ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW) (Proc. CSCW 2024)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments In Peer Review
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
Comments 34 pages, 6 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track; 9 pages, 5 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Neurips 2023 Poster
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments EMNLP 2023
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted at NeurIPS 2023
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments EMNLP 2023
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Code, demo and models are available at https://github.com/QwenLM/Qwen-VL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments ICCV 2023
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments ICCV'23 Oral. arXiv v2: fix typo in pseudocode; v3: clarify t vs t' init; v4: add SigLIP Base, Large, Shape-Optimized 400M results. Models released at: https://github.com/google-research/big_vision. Xiaohua and Lucas contributed equally
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、eess.AS
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM
Comments 5 pages, 5 tables, 1 figure
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted at GCPR 2023 (Oral)