arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

1909.13471 2019-11-19 cs.CV cs.LG 62%

On Incorporating Semantic Prior Knowledge in Deep Learning Through Embedding-Space Constraints

Damien Teney, Ehsan Abbasnejad, Anton van den Hengel

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.06306 2019-10-18 cs.CV cs.CL cs.LG eess.IV 62%

U-CAM: Visual Explanation using Uncertainty based Class Activation Maps

Badri N. Patro, Mayank Lunayach, Shivansh Patel, Vinay P. Namboodiri

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments ICCV 2019 (accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.04696 2019-09-12 cs.CV cs.AI 62%

Sunny and Dark Outside?! Improving Answer Consistency in VQA through Entailed Question Generation

Arijit Ray, Karan Sikka, Ajay Divakaran, Stefan Lee, Giedrius Burachas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 2019 Conference on Empirical Methods in Natural Language Processing (EMNLP 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.03683 2019-09-10 cs.CL cs.CV cs.LG 62%

Don't Take the Easy Way Out: Ensemble Based Methods for Avoiding Known Dataset Biases

Christopher Clark, Mark Yatskar, Luke Zettlemoyer

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments In EMNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.04342 2019-08-16 cs.CV cs.HC cs.LG 62%

Why Does a Visual Question Have Different Answers?

Nilavra Bhattacharya, Qing Li, Danna Gurari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Journal ref The IEEE International Conference on Computer Vision (ICCV) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.00061 2019-08-02 cs.CV cs.LG 62%

An Empirical Study of Batch Normalization and Group Normalization in Conditional Computation

Vincent Michalski, Vikram Voleti, Samira Ebrahimi Kahou, Anthony Ortiz, Pascal Vincent, Chris Pal, Doina Precup

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.02314 2019-05-06 cs.LG cs.AI 62%

Answering Visual-Relational Queries in Web-Extracted Knowledge Graphs

Daniel Oñoro-Rubio, Mathias Niepert, Alberto García-Durán, Roberto González, Roberto J. López-Sastre

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Journal ref AKBC2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.01385 2019-02-05 cs.LG cs.AI cs.CL cs.RO stat.ML 62%

Embodied Multimodal Multitask Learning

Devendra Singh Chaplot, Lisa Lee, Ruslan Salakhutdinov, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments See https://devendrachaplot.github.io/projects/EMML for demo videos

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03928 2019-01-16 cs.LG cs.CV stat.ML 62%

Learning Representations of Sets through Optimized Permutations

Yan Zhang, Jonathon Hare, Adam Prügel-Bennett

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Published in ICLR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.12535 2018-11-01 cs.CV cs.AI 62%

Gated Hierarchical Attention for Image Captioning

Qingzhong Wang, Antoni B. Chan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACCV

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.12698 2018-10-31 cs.LG cs.AI cs.CL stat.ML 62%

Compositional Attention Networks for Interpretability in Natural Language Question Answering

Muru Selvakumar, Suriyadeepan Ramamoorthy, Vaidheeswaran Archana, Malaikannan Sankarasubbu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments 8 pages,10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.12366 2018-10-31 cs.AI cs.CL cs.CV 62%

Do Explanations make VQA Models more Predictable to a Human?

Arjun Chandrasekaran, Viraj Prabhu, Deshraj Yadav, Prithvijit Chattopadhyay, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2018. 16 pages, 11 figures. Content overlaps with "It Takes Two to Tango: Towards Theory of AI's Mind" (arXiv:1704.00717)

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04344 2018-09-13 cs.CV cs.AI cs.CL 62%

The Wisdom of MaSSeS: Majority, Subjectivity, and Semantic Similarity in the Evaluation of VQA

Shailza Jolly, Sandro Pezzelle, Tassilo Klein, Andreas Dengel, Moin Nabi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.09942 2018-08-30 cs.CL cs.AI cs.LG 62%

Neural Compositional Denotational Semantics for Question Answering

Nitish Gupta, Mike Lewis

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.04706 2018-05-22 cs.LG cs.CV cs.NE 62%

Tree Memory Networks for Modelling Long-term Temporal Dependencies

Tharindu Fernando, Simon Denman, Aaron McFadyen, Sridha Sridharan, Clinton Fookes

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Journal ref Neurocomputing, Volume 304, 23 August 2018, Pages 64-81

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08129 2018-02-23 cs.AI cs.CL cs.CV 62%

Multimodal Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata, Anna Rohrbach, Bernt Schiele, Trevor Darrell, Marcus Rohrbach

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: text overlap with arXiv:1612.04757

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09356 2018-01-30 cs.CV cs.AI 62%

Game of Sketches: Deep Recurrent Models of Pictionary-style Word Guessing

Ravi Kiran Sarvadevabhatla, Shiv Surya, Trisha Mittal, Venkatesh Babu Radhakrishnan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments To be presented at AAAI-2018. Code, pre-trained models and dataset at github.com/val-iisc/sketchguess

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.00683 2017-12-20 cs.CV cs.CL cs.LG 62%

Modulating early visual processing by language

Harm de Vries, Florian Strub, Jérémie Mary, Hugo Larochelle, Olivier Pietquin, Aaron Courville

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Advances in Neural Information Processing Systems 30 (NIPS 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01238 2017-12-05 cs.CV cs.CL cs.LG 62%

Learning by Asking Questions

Ishan Misra, Ross Girshick, Rob Fergus, Martial Hebert, Abhinav Gupta, Laurens van der Maaten

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.00717 2017-10-03 cs.CV cs.AI cs.CL 62%

It Takes Two to Tango: Towards Theory of AI's Mind

Arjun Chandrasekaran, Deshraj Yadav, Prithvijit Chattopadhyay, Viraj Prabhu, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04686 2017-08-17 cs.CV cs.CL cs.LG 62%

VQS: Linking Segmentations to Questions and Answers for Supervised Attention in VQA and Question-Focused Semantic Segmentation

Chuang Gan, Yandong Li, Haoxiang Li, Chen Sun, Boqing Gong

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments To appear on ICCV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.04757 2017-07-26 cs.CV cs.AI cs.CL 62%

Attentive Explanations: Justifying Decisions and Pointing to the Evidence

Dong Huk Park, Lisa Anne Hendricks, Zeynep Akata, Bernt Schiele, Trevor Darrell, Marcus Rohrbach

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.02799 2017-07-25 cs.CV cs.CL cs.LG cs.NE 62%

Neural Module Networks

Jacob Andreas, Marcus Rohrbach, Trevor Darrell, Dan Klein

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Corrects an error in the evaluation of the NMN-only ablation experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06355 2017-07-21 cs.CV cs.AI cs.CL 62%

Video Question Answering via Attribute-Augmented Attention Network Learning

Yunan Ye, Zhou Zhao, Yimeng Li, Long Chen, Jun Xiao, Yueting Zhuang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted for SIGIR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.04517 2017-04-18 cs.CL cs.AI cs.CV 62%

ShapeWorld - A new test methodology for multimodal language understanding

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.07450 2017-01-26 stat.ML cs.CV cs.LG 62%

Grad-CAM: Why did you say that?

Ramprasaath R Selvaraju, Abhishek Das, Ramakrishna Vedantam, Michael Cogswell, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Presented at NIPS 2016 Workshop on Interpretable Machine Learning in Complex Systems. This is an extended abstract version of arXiv:1610.02391 (CVPR format)

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.06622 2016-09-27 cs.CV cs.CL cs.LG 62%

Question Relevance in VQA: Identifying Non-Visual And False-Premise Questions

Arijit Ray, Gordon Christie, Mohit Bansal, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Conference on Empirical Methods in Natural Language Processing (EMNLP) 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08188 2016-08-30 cs.AI cs.CL cs.CV cs.HC 62%

Visual Question: Predicting If a Crowd Will Agree on the Answer

Danna Gurari, Kristen Grauman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.05099 2016-04-20 cs.CL cs.CV cs.LG 62%

Yin and Yang: Balancing and Answering Binary Visual Questions

Peng Zhang, Yash Goyal, Douglas Summers-Stay, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.01715 2015-12-17 cs.CV cs.AI 62%

A Restricted Visual Turing Test for Deep Scene and Event Understanding

Hang Qi, Tianfu Wu, Mun-Wai Lee, Song-Chun Zhu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏