Transfer Learning via Unsupervised Task Discovery for Visual Question Answering
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments CVPR 2019
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments CVPR 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 5 figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 17 pages, 4 figures, accepted in ECCV 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 5 pages, 2 figures, accepted to ICIP 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments 8 pages, 3 figures. To appear in CRV, 2018, 15th Canadian Conference on Computer and Robot Vision
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments ICLR 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments To appear in AAAI 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments To appear in ICCV 2017. Visit http://kushalkafle.com/projects/tdiuc to download the dataset
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 10 pages, 3 figures, 3 tables Added references, corrected typos, made references less wordy
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments include test-standard result on VQA full release (V1.0) dataset
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Accepted by TIP2023, The Arxiv version of "Weakly-Supervised 3D Spatial Reasoning for Text-based Visual Question Answering"
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments CVPR 2018 full oral, winner of the 2017 Visual Question Answering challenge
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR
CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Anzhen Hospital(北京安贞医院) ; Beihang University(北航) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。
NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准
机构 * Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。
Comments 30 pages, dataset and benchmark release
OpenLifelogQA:一个开放式多模态生活日志问答数据集
专题命中 视觉问答 :LLaVA(summary_cn,abstract)
AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。
Comments In the proceedings of the 14th International Symposium on Information and Communication Technology
重新思考多模态问答中的信息合成:多智能体视角
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);visual language model(abstract);multimodal large language model(abstract)
AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。
机构 * TCS Research(塔塔咨询研究)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/
机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication in AAAI 2025 (Main Track)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments To appear in ACL Findings, 2024
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page: https://janghyuncho.github.io/Cube-LLM
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory