arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2112.13706 2022-02-08 cs.CV cs.AI cs.LG 82%

Multi-Image Visual Question Answering

Harsh Raj, Janhavi Dadhania, Akhilesh Bhardwaj, Prabuchandran KJ

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13906 2021-12-30 cs.CV cs.AI cs.CL cs.LG 82%

Does CLIP Benefit Visual Question Answering in the Medical Domain as Much as it Does in the General Domain?

Sedigheh Eslami, Gerard de Melo, Christoph Meinel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10906 2021-11-19 cs.CV cs.AI cs.CL cs.LG 82%

Single-Modal Entropy based Active Learning for Visual Question Answering

Dong-Jin Kim, Jae Won Cho, Jinsoo Choi, Yunjae Jung, In So Kweon

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to BMVC 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02331 2021-07-07 cs.CL cs.AI cs.CV cs.LG 82%

Mind Your Outliers! Investigating the Negative Impact of Outliers on Active Learning for Visual Question Answering

Siddharth Karamcheti, Ranjay Krishna, Li Fei-Fei, Christopher D. Manning

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ACL-IJCNLP 2021. 17 pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07583 2020-12-04 cs.CV cs.AI cs.CL cs.LG 82%

Inverse Visual Question Answering with Multi-Level Attentions

Yaser Alwattar, Yuhong Guo

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10731 2020-11-24 cs.CL cs.AI cs.CV cs.LG 82%

LRTA: A Transparent Neural-Symbolic Reasoning Framework with Modular Supervision for Visual Question Answering

Weixin Liang, Feiyang Niu, Aishwarya Reganti, Govind Thattai, Gokhan Tur

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS KR2ML 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09073 2020-11-05 cs.CV cs.AI cs.CL cs.LG 82%

Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering

Zihao Zhu, Jing Yu, Yujing Wang, Yajing Sun, Yue Hu, Qi Wu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.11673 2020-02-03 cs.AI cs.CL cs.CV cs.LG 82%

Augmenting Visual Question Answering with Semantic Frame Information in a Multitask Learning Approach

Mehrdad Alizadeh, Barbara Di Eugenio

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 14th IEEE International Conference on SEMANTIC COMPUTING, 8 Pages, February 2020, San Diego CA USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.08730 2020-01-24 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

Robust Explanations for Visual Question Answering

Badri N. Patro, Shivansh Pate, Vinay P. Namboodiri

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments WACV-2020 (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.07864 2019-07-01 cs.LG cs.AI cs.CV stat.ML 82%

Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering

Ramakrishna Vedantam, Karan Desai, Stefan Lee, Marcus Rohrbach, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2019 Camera Ready + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.11737 2019-06-05 cs.CV cs.AI cs.CL cs.LG 82%

The meaning of "most" for visual question answering models

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.09487 2019-02-26 cs.CV cs.AI cs.CL cs.LG 82%

MUREL: Multimodal Relational Reasoning for Visual Question Answering

Remi Cadene, Hedi Ben-younes, Matthieu Cord, Nicolas Thome

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2019 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00300 2018-08-02 cs.CV cs.AI cs.CL cs.LG cs.NE 82%

Learning Visual Question Answering by Bootstrapping Hard Attention

Mateusz Malinowski, Carl Doersch, Adam Santoro, Peter Battaglia

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.09701 2018-07-23 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

R-VQA: Learning Visual Relation Facts with Semantic Attention for Visual Question Answering

Pan Lu, Lei Ji, Wei Zhang, Nan Duan, Ming Zhou, Jianyong Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 5 figures, accepted as an oral paper in SIGKDD 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.07121 2018-06-12 cs.CL cs.AI cs.CV cs.LG 82%

Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets

Wei-Lun Chao, Hexiang Hu, Fei Sha

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted for Oral Presentation at NAACL-HLT 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.04323 2017-11-15 cs.CV cs.AI cs.LG 82%

High-Order Attention Models for Visual Question Answering

Idan Schwartz, Alexander G. Schwing, Tamir Hazan

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 9 pages, 8 figures, NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00837 2017-05-16 cs.CV cs.AI cs.CL cs.LG 82%

Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering

Yash Goyal, Tejas Khot, Douglas Summers-Stay, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.08243 2017-04-27 cs.CV cs.AI cs.CL cs.LG 82%

C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset

Aishwarya Agrawal, Aniruddha Kembhavi, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.07356 2016-10-05 cs.CL cs.AI cs.CV cs.LG 82%

Analyzing the Behavior of Visual Question Answering Models

Aishwarya Agrawal, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 13 pages, 20 figures; To appear in EMNLP 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08974 2016-09-12 cs.CV cs.AI cs.CL cs.LG 82%

Towards Transparent AI Systems: Interpreting Visual Question Answering Models

Yash Goyal, Akrit Mohapatra, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08716 2016-09-01 cs.AI cs.CL cs.CV cs.LG 82%

Measuring Machine Intelligence Through Visual Question Answering

C. Lawrence Zitnick, Aishwarya Agrawal, Stanislaw Antol, Margaret Mitchell, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments AI Magazine, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07303 2024-09-24 cs.CV cs.CL cs.LG 82%

Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion

Peiyuan Chen, Zecheng Zhang, Yiping Dong, Li Zhou, Han Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09192 2019-09-23 cs.LG cs.CL cs.CV stat.ML 82%

Learning Sparse Mixture of Experts for Visual Question Answering

Vardaan Pahuja, Jie Fu, Christopher J. Pal

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07724 2018-03-22 cs.CL cs.AI cs.CV 82%

Attention on Attention: Architectures for Visual Question Answering (VQA)

Jasdeep Singh, Vincent Ying, Alex Nutkiewicz

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Visual Question Answering Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01660 2026-08-04 cs.CV 新提交 81%

Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering

锚定、覆盖与优化:面向长视频问答的以证据为中心的帧选择框架

Fan Wei, Siru Zhong, Runmin Dong, Miao Yang, Zhaoyang Luo, Haohuan Fu

专题命中 视觉问答 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对长视频问答中视觉预算有限及证据对齐弱的问题,提出无需训练的GCR框架,通过锚定、覆盖、优化三步选择帧,在LongVideoBench等基准上较基线取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28568 2026-08-04 cs.CV 版本更新 81%

XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs

XSPA:构建不可察觉的X形稀疏对抗扰动以对视觉语言模型的可迁移攻击

Chengyin Hu, Jiaju Han, Xuemeng Sun, Qike Zhang, Luwei Yang, Lehan Sun, Jiahuan Long, Yiwei Wei, Jiujiang Guo

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出XSPA攻击,通过限制扰动为两条相交对角线,测试VLMs在稀疏扰动下的鲁棒性,实验表明其能显著破坏跨任务语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 81%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-07-20 cs.CV 新提交 81%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 81%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24335 2026-06-24 cs.CV 新提交 81%

Ill-Posed by Design: Probing Evidence Use in VLMs

刻意设计的不适定问题:探究VLMs中的证据使用

Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出单目物体尺寸估计作为不适定诊断任务,通过反事实分析分解六种视觉和语言证据通道,评估12个开源VLM,发现最大模型仍落后于纯文本LLM,且模型未有效利用场景几何信息。

详情

展开后加载摘要…

URL PDF HTML 收藏