Grounding Multilingual Multimodal LLMs With Cultural Knowledge
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(title);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(title);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
机构 * School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院) ; SEDE, University of Technology Sydney(技术悉尼大学SEDE) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
Comments This paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)
机构 * Peking University Beijing China ; Huawei Technologies Ltd. Beijing China ; Shanghai AI Laboratory Shanghai China ; Peking University Center for Machine Learning Research Beijing China ; Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China ; Peking University ; Huawei Technologies Ltd. ; Shanghai AI Laboratory
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
机构 * Media and Data Science Research Lab, Adobe(媒体与数据科学研究实验室,Adobe)
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted in ICCV 2025 Workshop on What's Next in Multimodal Foundational Models
机构 * Sun Yat-sen University(中山大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)
Comments 17 pages, 6 figures, 3 tables
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)
Comments 8 pages, 4 figures
专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
Comments 13 pages, 8 figures
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to AAAI2025(Oral)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted to ECCV 2024 as Oral paper
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)
Comments 12 pages, 5 figures
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He
专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);visual language model(abstract);分类 cs.CV
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
Comments 21 pages, 15 figures
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 21 pages, 14 figures, 6 tables
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted by TMLR
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments ECCV 2024 Workshop EVAL-FoMo; Project Page: https://katha-ai.github.io/projects/detect-describe-discriminate/
专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 14 pages, 8 figures
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ICML workshop 2024
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.LG
Comments 13 pages
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 20 pages, 12 figures, 7 tables
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 17 pages