LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments This thesis, awarded a distinction by the Department of Computer Science at University College London, was successfully defended by the author in September 2024 in partial fulfillment of the requirements for an MSc in Emerging Digital Technologies
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments NeurIPS 2024
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments 15 pages, 7 figures
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Journal ref IEEE Trans. Geosci. Remote Sens., vol. 62, pp. 1-13, 2024
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 11 pages, 6 figures, technical report
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments 10 pages
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments 11 pages, 2 figures
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This is a survey paper on recent state of the art VL models that can be used for memes classification. it has 15 pages and 2 figures
Journal ref SCA 2020
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 28 pages, 11 figures, under review
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments Github: https://github.com/JiuTian-VL/MoME
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted for Publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV
Comments 13 pages, 3 figures
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 22pages, 5 Figures, 6 tables, the extension of CMSEI in WACV23, and submitted to ACM TIST. arXiv admin note: text overlap with arXiv:2210.08908
专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments ICLR 2024 camera-ready; Code: https://github.com/naver-ai/pcmepp. Project page: https://naver-ai.github.io/pcmepp/. 30 pages, 2.2 MB
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments NAACL 2024
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 14 pages, 4 figures
专题命中 图文多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments 19 pages, 4 figures and 9 tables
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted in CVPR 2024
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
Comments 32 pages, 20 figures, 7 tables
Journal ref ICLR 2024
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
Comments 10 pages, 10 figures, Proceedings of AAAI Spring Symposium: Empowering Machine Learning and Large Language Models with Domain and Commonsense Knowledge (MAKE). AAAI (2024)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV