WeatherQA: Can Multimodal Language Models Reason about Severe Weather?
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 26 pages, 9 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 26 pages, 9 figures
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Code available https://github.com/alanaai/EVUD
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments ICLR 2024 Camera-ready
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR'24. (Compared with preprint version, we mainly improve the presentation, discuss more related works, and extend experiments in Appendix.)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at WACV 2024
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Published on CVPR 2023
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Jiasen Lu and Vedanuj Goswami contributed equally to this work
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Accepted at NeurIPS 2019 workshop: ViGIL
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments ECCV 2018 + results on VisDial v1.0 dataset
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments CVPR 2016
通过结构化内联引文生成实现显式证据基础
机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 视觉问答 :grounding(title)
AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。
耶鲁-DM实验室参加ArchEHR-QA 2026:用于电子病历问答的确定性接地和多轮证据对齐
机构 * Yale University(耶鲁大学)
专题命中 视觉问答 :grounding(title)
AI总结 本文提出确定性接地和多轮证据对齐方法,用于电子病历问答任务,通过模型多样性与投票策略提升性能,实验结果显示对齐准确率受限于推理能力。
Comments 9 pages, 2 figures. System description for ArchEHR-QA 2026 shared task
专题命中 视觉问答 :vision-language model(title)
机构 * Computational Linguistics, Department of Linguistics, Bielefeld University(语言学计算系,语言学系,比勒菲尔德大学) ; Honda Research Institute Europe(本田欧洲研究院) ; Digital Linguistics Lab, Department of Linguistics, Bielefeld University(数字语言学实验室,语言学系,比勒菲尔德大学)
专题命中 视觉问答 :visual question answering(title)
Comments 17 pages (including Appendix). Accepted at EMNLP 2024 main
Journal ref Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 19459-19475
专题命中 视觉问答 :multimodal large language model(title)
专题命中 视觉问答 :visual question answering(title)
专题命中 视觉问答 :grounding(title)
专题命中 视觉问答 :vision-language model(title)
专题命中 视觉问答 :visual question answering(title)
从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。