arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2210.10362 2022-11-16 cs.CV cs.AI cs.CL 62%

CPL: Counterfactual Prompt Learning for Vision and Language Models

Xuehai He, Diji Yang, Weixi Feng, Tsu-Jui Fu, Arjun Akula, Varun Jampani, Pradyumna Narayana, Sugato Basu, William Yang Wang, Xin Eric Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04872 2022-11-10 cs.CV cs.AI 62%

Visual Named Entity Linking: A New Dataset and A Baseline

Wenxiang Sun, Yixing Fan, Jiafeng Guo, Ruqing Zhang, Xueqi Cheng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 11 figures, published to EMNLP 2022(findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14156 2022-11-03 cs.CV cs.AI cs.CL 62%

TVLT: Textless Vision-Language Transformer

Zineng Tang, Jaemin Cho, Yixin Nie, Mohit Bansal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2022 Oral (21 pages; the first three authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12576 2022-10-12 cs.CL cs.AI cs.CV cs.HC 62%

WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models

Yonatan Bitton, Nitzan Bitton Guetta, Ron Yosef, Yuval Elovici, Mohit Bansal, Gabriel Stanovsky, Roy Schwartz

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2022, Datasets and Benchmarks. Website: https://winogavil.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09019 2022-09-20 cs.CV cs.CL cs.LG 62%

LAVIS: A Library for Language-Vision Intelligence

Dongxu Li, Junnan Li, Hung Le, Guangsen Wang, Silvio Savarese, Steven C. H. Hoi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Preprint of LAVIS technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.01988 2022-08-05 cs.LG cs.AI stat.ML 62%

Sparse Continuous Distributions and Fenchel-Young Losses

André F. T. Martins, Marcos Treviso, António Farinhas, Pedro M. Q. Aguiar, Mário A. T. Figueiredo, Mathieu Blondel, Vlad Niculae

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments JMLR 2022 camera ready version. arXiv admin note: text overlap with arXiv:2006.07214

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06675 2022-07-15 cs.AI cs.CV cs.CY 62%

Can Machines Help Us Answering Question 16 in Datasheets, and In Turn Reflecting on Inappropriate Content?

Patrick Schramowski, Christopher Tauchmann, Kristian Kersting

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: text overlap with arXiv:2110.04222

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05281 2022-06-14 cs.CV cs.CL cs.LG 62%

Less Is More: Linear Layers on CLIP Features as Powerful VizWiz Model

Fabian Deuser, Konrad Habel, Philipp J. Rösch, Norbert Oswald

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments VizWiz Grand Challenge: Describing Images and Videos Taken by Blind People (CVPR Workshop 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13724 2022-06-01 cs.AI cs.CV 62%

V-Doc : Visual questions answers with Documents

Yihao Ding, Zhe Huang, Runlin Wang, Yanhang Zhang, Xianru Chen, Yuzhong Ma, Hyunsuk Chung, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05019 2022-05-12 cs.CV cs.CL cs.LG 62%

Learning to Answer Visual Questions from Web Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted at the TPAMI Special Issue on the Best Papers of ICCV 2021. Journal extension of the conference paper arXiv:2012.00451. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04061 2022-05-10 cs.CV cs.AI 62%

Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering

Min Peng, Chongyang Wang, Yuan Gao, Yu Shi, Xiang-Dong Zhou

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2022. arXiv admin note: text overlap with arXiv:2109.04735

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06386 2022-03-31 cs.CL cs.AI cs.CV 62%

Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation

Wenliang Dai, Lu Hou, Lifeng Shang, Xin Jiang, Qun Liu, Pascale Fung

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07664 2022-03-16 cs.CV cs.AI 62%

Can you even tell left from right? Presenting a new challenge for VQA

Sai Raam Venkatraman, Rishi Rao, S. Balasubramanian, Chandra Sekhar Vorugunti, R. Raghunatha Sarma

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05017 2022-02-15 cs.CL cs.AI cs.LG 62%

Towards Automated Error Analysis: Learning to Characterize Errors

Tong Gao, Shivang Singh, Raymond J. Mooney

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04306 2022-02-10 cs.AI cs.CL cs.CV 62%

Can Open Domain Question Answering Systems Answer Visual Knowledge Questions?

Jiawen Zhang, Abhijit Mishra, Avinesh P. V. S, Siddharth Patwardhan, Sachin Agarwal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 9 pages (including references), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08170 2022-01-19 cs.LG cs.CV 62%

How Modular Should Neural Module Networks Be for Systematic Generalization?

Vanessa D'Amario, Tomotake Sasaki, Xavier Boix

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Journal ref 35th Conference on Neural Information Processing Systems (NeurIPS 2021), Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03342 2022-01-11 cs.CV cs.LG cs.MM 62%

COIN: Counterfactual Image Generation for VQA Interpretation

Zeyd Boukhers, Timo Hartmann, Jan Jürjens

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05587 2021-12-16 cs.CV cs.CL cs.LG 62%

Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation

Tianyi Liu, Zuxuan Wu, Wenhan Xiong, Jingjing Chen, Yu-Gang Jiang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11832 2021-12-16 cs.CV cs.CL cs.LG 62%

Playing Lottery Tickets with Vision and Language

Zhe Gan, Yen-Chun Chen, Linjie Li, Tianlong Chen, Yu Cheng, Shuohang Wang, Jingjing Liu, Lijuan Wang, Zicheng Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06416 2021-11-02 cs.CV cs.LG 62%

MMIU: Dataset for Visual Intent Understanding in Multimodal Assistants

Alkesh Patel, Joel Ruben Antony Moniz, Roman Nguyen, Nick Tzou, Hadas Kotek, Vincent Renkens

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Extended abstract accepted for WeCNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.14712 2021-10-27 cs.CV cs.AI cs.CY cs.HC 62%

Generating and Evaluating Explanations of Attended and Error-Inducing Input Regions for VQA Models

Arijit Ray, Michael Cogswell, Xiao Lin, Kamran Alipour, Ajay Divakaran, Yi Yao, Giedrius Burachas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Applied AI Letters, Wiley, 25 October 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06863 2021-10-19 cs.CV cs.AI cs.HC 62%

Improving Users' Mental Model with Attention-directed Counterfactual Edits

Kamran Alipour, Arijit Ray, Xiao Lin, Michael Cogswell, Jurgen P. Schulze, Yi Yao, Giedrius T. Burachas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in Applied AI Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04484 2021-09-20 cs.CV cs.CL cs.LG 62%

Are VQA Systems RAD? Measuring Robustness to Augmented Data with Focused Interventions

Daniel Rosenberg, Itai Gat, Amir Feder, Roi Reichart

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments ACL 2021. Our code and data are available at https://danrosenberg.github.io/rad-measure/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.00451 2021-08-13 cs.CV cs.CL cs.LG 62%

Just Ask: Learning to Answer Questions from Millions of Narrated Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted at ICCV 2021 (Oral); 20 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04938 2021-08-12 cs.CV cs.AI cs.CL 62%

BERTHop: An Effective Vision-and-Language Model for Chest X-ray Disease Diagnosis

Masoud Monajatipoor, Mozhdeh Rouhsedaghat, Liunian Harold Li, Aichi Chien, C. -C. Jay Kuo, Fabien Scalzo, Kai-Wei Chang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 8 figures, Accepted in ICCV workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.10446 2021-06-22 cs.CV cs.AI 62%

Attend What You Need: Motion-Appearance Synergistic Networks for Video Question Answering

Ahjeong Seo, Gi-Cheon Kang, Joonhan Park, Byoung-Tak Zhang

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

Comments ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.12852 2021-06-18 cs.CV cs.AI 62%

Beyond VQA: Generating Multi-word Answer and Rationale to Visual Questions

Radhika Dua, Sai Srinivas Kancheti, Vineeth N Balasubramanian

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments MULA Workshop, CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04630 2021-06-10 cs.CV cs.CL cs.LG 62%

PAM: Understanding Product Images in Cross Product Category Attribute Extraction

Rongmei Lin, Xiang He, Jie Feng, Nasser Zalmout, Yan Liang, Li Xiong, Xin Luna Dong

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments KDD 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.06365 2021-04-14 cs.LG cs.CV 62%

Neuro-Symbolic VQA: A review from the perspective of AGI desiderata

Ian Berlot-Attwell

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.03046 2021-04-08 cs.CV cs.LG 62%

Multimodal Continuous Visual Attention Mechanisms

António Farinhas, André F. T. Martins, Pedro M. Q. Aguiar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏