FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by CVPR2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by CVPR2025
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
Comments Preprint
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Accepted for publication at NeruIPS 2024 Dataset and Benchmark Track
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments ICML 2024. Code: https://github.com/sdc17/CrossGET
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
Comments Project Page: https://sid2697.github.io/hoi-ref/
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 8
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Preprint
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments ACM TOMM 2021
时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况
机构 * Microsoft(微软) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :VLM(title);分类 cs.CV、cs.LG
AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。
Comments 9 pages, 11 pages supplemental
面向位置的预训练方法用于医学差异视觉问答
机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) ; University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。
Comments 11 pages
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Imperial College London(帝国理工学院伦敦分校) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI
Comments Early accepted by MICCAI2025
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :vision-language model(title);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2024 Tiny Papers(Notable)
专题命中 视觉问答 :vision-language model(title);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG
Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit
专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments To appear in: Proc. of the Future Technologies Conference (FTC) 2023, Nov. 2-3, San Francisco, pub. by Springer Nature
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug
专题命中 视觉问答 :grounding(title);分类 cs.CV、cs.AI
Comments ACL 2020 camera-ready (15 pages)
专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI