arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2208.08104 2022-09-23 cs.CV cs.CL 57%

Understanding Attention for Vision-and-Language Tasks

Feiqi Cao, Soyeon Caren Han, Siqu Long, Changwei Xu, Josiah Poon

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted in COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.11333 2022-09-22 cs.CV 57%

Multi-modal Understanding and Generation for Medical Images and Text via Vision-Language Pre-Training

Jong Hak Moon, Hyungyung Lee, Woncheol Shin, Young-Hak Kim, Edward Choi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by IEEE Journal of Biomedical and Health Informatics

Journal ref IEEE Journal of Biomedical and Health Informatics 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06730 2022-09-15 cs.CV 57%

MUST-VQA: MUltilingual Scene-text VQA

Emanuele Vivoli, Ali Furkan Biten, Andres Mafla, Dimosthenis Karatzas, Lluis Gomez

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments To be appeared in Text In Everything Workshop in ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.05014 2022-09-15 cs.CV 57%

An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA

Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Yumao Lu, Zicheng Liu, Lijuan Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments AAAI 2022 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04372 2022-09-12 cs.CV 57%

Pre-training image-language transformers for open-vocabulary tasks

AJ Piergiovanni, Weicheng Kuo, Anelia Angelova

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03609 2022-09-09 cs.CV cs.MM 57%

Frame-Subtitle Self-Supervision for Multi-Modal Video Question Answering

Jiong Wang, Zhou Zhao, Weike Jin

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.05595 2022-09-05 cs.CV 57%

An Entropy Clustering Approach for Assessing Visual Question Difficulty

Kento Terao, Toru Tamaki, Bisser Raytchev, Kazufumi Kaneda, Shun'ichi Satoh

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Journal ref IEEE Access, Vol.8, pp. 180633-180645, Sep 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.12037 2022-08-31 cs.CV 57%

Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task

Stan Weixian Lei, Difei Gao, Jay Zhangjie Wu, Yuxuan Wang, Wei Liu, Mengmi Zhang, Mike Zheng Shou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10760 2022-08-26 cs.CV 57%

How good are deep models in understanding the generated images?

Ali Borji

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04713 2022-08-05 cs.LG cs.DB cs.DC 57%

Serving and Optimizing Machine Learning Workflows on Heterogeneous Infrastructures

Yongji Wu, Matthew Lentz, Danyang Zhuo, Yao Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11850 2022-07-26 cs.CV 57%

Visual Perturbation-aware Collaborative Learning for Overcoming the Language Prior Problem

Yudong Han, Liqiang Nie, Jianhua Yin, Jianlong Wu, Yan Yan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 13 pages, 10 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11732 2022-07-19 cs.CL cs.CV 57%

IGLUE: A Benchmark for Transfer Learning across Modalities, Tasks, and Languages

Emanuele Bugliarello, Fangyu Liu, Jonas Pfeiffer, Siva Reddy, Desmond Elliott, Edoardo Maria Ponti, Ivan Vulić

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14989 2022-07-01 cs.CV 57%

A Unified End-to-End Retriever-Reader Framework for Knowledge-based VQA

Yangyang Guo, Liqiang Nie, Yongkang Wong, Yibing Liu, Zhiyong Cheng, Mohan Kankanhalli

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.09599 2022-06-20 cs.LG cs.CL 57%

Label-Descriptive Patterns and Their Application to Characterizing Classification Errors

Michael Hedderich, Jonas Fischer, Dietrich Klakow, Jilles Vreeken

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments Accepted at ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01017 2022-06-03 cs.CV 57%

Structured Two-stream Attention Network for Video Question Answering

Lianli Gao, Pengpeng Zeng, Jingkuan Song, Yuan-Fang Li, Wu Liu, Tao Mei, Heng Tao Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14895 2022-05-31 cs.CV cs.CL cs.MM 57%

From Representation to Reasoning: Towards both Evidence and Commonsense Reasoning for Video Question-Answering

Jiangtong Li, Li Niu, Liqing Zhang

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments To appear in CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05115 2022-05-24 cs.CL cs.LG 57%

Internet-augmented language models through few-shot prompting for open-domain question answering

Angeliki Lazaridou, Elena Gribovskaya, Wojciech Stokowiec, Nikolai Grigorev

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01883 2022-05-05 cs.CV cs.CL 57%

All You May Need for VQA are Image Captions

Soravit Changpinyo, Doron Kukliansky, Idan Szpektor, Xi Chen, Nan Ding, Radu Soricut

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 2022 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07302 2022-04-18 cs.CV cs.CL 57%

Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning

Feilong Chen, Xiuyi Chen, Shuang Xu, Bo Xu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14072 2022-04-06 cs.CV 57%

Learning to Answer Questions in Dynamic Audio-Visual Scenarios

Guangyao Li, Yake Wei, Yapeng Tian, Chenliang Xu, Ji-Rong Wen, Di Hu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR2022 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10401 2022-03-29 cs.CV 57%

Vision-Language Pre-Training with Triple Contrastive Learning

Jinyu Yang, Jiali Duan, Son Tran, Yi Xu, Sampath Chanda, Liqun Chen, Belinda Zeng, Trishul Chilimbi, Junzhou Huang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2022; code: https://github.com/uta-smile/TCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07190 2022-03-15 cs.CV cs.CL 57%

CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment

Haoyu Song, Li Dong, Wei-Nan Zhang, Ting Liu, Furu Wei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ACL 2022 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05081 2022-03-11 cs.CV cs.CL 57%

NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language Tasks

Fawaz Sammani, Tanmoy Mukherjee, Nikos Deligiannis

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06858 2022-02-15 cs.CV 57%

An experimental study of the vision-bottleneck in VQA

Pierre Marza, Corentin Kervadec, Grigory Antipov, Moez Baccouche, Christian Wolf

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04015 2022-02-09 cs.CV cs.MM 57%

NEWSKVQA: Knowledge-Aware News Video Question Answering

Pranay Gupta, Manish Gupta

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12494 2021-12-28 cs.CV 57%

LaTr: Layout-Aware Transformer for Scene-Text VQA

Ali Furkan Biten, Ron Litman, Yusheng Xie, Srikar Appalaraju, R. Manmatha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03879 2021-12-23 cs.CL cs.CV 57%

AI2D-RST: A multimodal corpus of 1000 primary school science diagrams

Tuomo Hiippala, Malihe Alikhani, Jonas Haverinen, Timo Kalliokoski, Evanfiya Logacheva, Serafina Orekhova, Aino Tuomainen, Matthew Stone, John A. Bateman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 24 pages; revised version submitted to Language Resources & Evaluation

Journal ref Language Resources and Evaluation 55(3), 2021, pp. 661-688

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16010 2021-12-15 cs.CV 57%

Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a Class-imbalance View

Yangyang Guo, Liqiang Nie, Zhiyong Cheng, Qi Tian, Min Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.12248 2021-12-15 cs.CV cs.CL 57%

Multi-Modal Answer Validation for Knowledge-Based VQA

Jialin Wu, Jiasen Lu, Ashish Sabharwal, Roozbeh Mottaghi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02839 2021-12-07 cs.MM cs.AI 57%

MoCA: Incorporating Multi-stage Domain Pretraining and Cross-guided Multimodal Attention for Textbook Question Answering

Fangzhi Xu, Qika Lin, Jun Liu, Lingling Zhang, Tianzhe Zhao, Qi Chai, Yudai Pan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏