Multi-Image Visual Question Answering
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to BMVC 2021
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at ACL-IJCNLP 2021. 17 pages, 16 Figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS KR2ML 2020
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 14th IEEE International Conference on SEMANTIC COMPUTING, 8 Pages, February 2020, San Diego CA USA
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments WACV-2020 (Accepted)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICML 2019 Camera Ready + Appendix
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR2019 accepted paper
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ECCV 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 10 pages, 5 figures, accepted as an oral paper in SIGKDD 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for Oral Presentation at NAACL-HLT 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 9 pages, 8 figures, NIPS 2017
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 13 pages, 20 figures; To appear in EMNLP 2016
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments AI Magazine, 2016
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments Visual Question Answering Project
锚定、覆盖与优化:面向长视频问答的以证据为中心的帧选择框架
专题命中 视觉问答 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对长视频问答中视觉预算有限及证据对齐弱的问题,提出无需训练的GCR框架,通过锚定、覆盖、优化三步选择帧,在LongVideoBench等基准上较基线取得显著性能提升。
XSPA:构建不可察觉的X形稀疏对抗扰动以对视觉语言模型的可迁移攻击
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出XSPA攻击,通过限制扰动为两条相交对角线,测试VLMs在稀疏扰动下的鲁棒性,实验表明其能显著破坏跨任务语义。
LoMeVQA:纵向医学视觉问答综合基准
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。
Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA
视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐
机构 * Singapore Institute of Technology(新加坡科技学院) ; NVIDIA(英伟达)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。
Comments Accepted at ACM Multimedia 2026
SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解
机构 * The University of Queensland(昆士兰大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; University of Technology Sydney(悉尼科技大学) ; Follow Me AI Pty LTD(Follow Me AI有限公司)
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。
Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $
刻意设计的不适定问题:探究VLMs中的证据使用
机构 * Tel Aviv University(特拉维夫大学) ; IBM Research(IBM研究院)
专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。