ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Project link: https://zeyofu.github.io/ReFocus/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 2 pages, 1 figure
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments GitHub: https://github.com/uni-medical/GMAI-MMBench Hugging face: https://huggingface.co/datasets/OpenGVLab/GMAI-MMBench
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Demo page: https://om-cat.github.io
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.AI
Comments EMNLP 2024 Findings
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Project Page: https://jaywonkoo17.github.io/PropTest/
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at the 16th IAPR International Workshop On Document Analysis Systems (DAS)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments 20 pages
专题命中 视觉问答 :VLM(abstract);visual language model(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ICLR 2024. The first two authors contributed equally and are alphabetically ordered. Project page: https://ai.stanford.edu/~yzzhang/projects/concept-axes/
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
Comments 11 pages main paper, 2 pages supplementary
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments Work in progress
专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at LLVM-AD Workshop @ WACV 2024
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Accepted to EMNLP 2023 Findings
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Code is available at https://github.com/dvlab-research/LLaMA-VID