GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
专题命中 视觉问答 :multimodal large language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :multimodal large language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 15 images
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :LLaVA(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments ICLR2025
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Dataset available at https://github.com/facebookresearch/multimodal_rewardbench
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2024. The code is available at https://github.com/showlab/LOVA3
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 22 pages, 10 figures, 16 tables
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 23 pages, 21 figures; project page: https://ffaa-vl.github.io
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments 17 pages, 6 figures
专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments resubmit to www2025
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to EMNLP 2024 Main Conference
专题命中 视觉问答 :VLM(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2024. Benchmark and dataset are available at https://github.com/wayveai/LingoQA/
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 7 figures
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted to the IEEE International Conference on Image Processing (IEEE ICIP) 2024
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted in ACL 2024 (Findings), 21 pages, 7 figures, 9 Tables
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted at 1st Workshop on Multimodalities for 3D Scenes CVPR 2024
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
Comments To be published in the Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci'24)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Accepted as Spotlight Paper for ICLR 2024. The first two authors contributed equally to this work
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments EMNLP 2023 main
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by IEEE Geoscience and Remote Sensing Magazine
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 21 pages,9 figures
专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Accepted by IEEE TPAMI