Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 10 figures, publised to AAAI 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments 9 pages, 10 figures, publised to AAAI 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICASSP 2025. Camera Ready Version
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.MM
Comments This paper got accepted by IEEE TMM
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL、cs.MM
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by NIPS2024
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments ICIP 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted in AAAI 2025
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments Accepted for publication, 26th Int. Symp. on Multimedia (IEEE ISM 2024), Tokyo, Japan, Dec. 2024. This is the authors' "accepted version"
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments Project Page: https://catherine-r-he.github.io/SynGround/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI25
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Preprint
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 10 Pages
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments the correct arxiv version
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments 24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments 18 pages
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 7 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 10 figures, journal article
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ML4H 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL