arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2408.12480 2024-08-26 cs.LG cs.CL 83%

Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese

Khang T. Doan, Bao G. Huynh, Dung T. Hoang, Thuc D. Pham, Nhat H. Pham, Quan T. M. Nguyen, Bang Q. Vo, Suong N. Hoang

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06400 2024-08-23 cs.CL cs.CV 83%

Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model

Taehee Kim, Yeongjae Cho, Heejun Shin, Yohan Jo, Dongmyung Shin

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17419 2024-08-22 cs.CV 83%

AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors

You-Ming Chang, Chen Yeh, Wei-Chen Chiu, Ning Yu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03043 2024-08-07 cs.CV 83%

Targeted Visual Prompting for Medical Visual Question Answering

Sergio Tascon-Morales, Pablo Márquez-Neila, Raphael Sznitman

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted at the MICCAI AMAI Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00300 2024-08-02 cs.CV cs.MM 83%

Towards Flexible Evaluation for Generative Visual Question Answering

Huishan Ji, Qingyi Si, Zheng Lin, Weiping Wang

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07163 2024-05-14 physics.ed-ph cs.AI 83%

Realizing Visual Question Answering for Education: GPT-4V as a Multimodal AI

Gyeong-Geon Lee, Xiaoming Zhai

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03203 2024-03-06 cs.AI 83%

CLEVR-POC: Reasoning-Intensive Visual Question Answering in Partially Observable Environments

Savitha Sam Abraham, Marjan Alirezaie, Luc De Raedt

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.AI

Comments 17 pages, 10 images, Accepted at LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02707 2024-03-06 cs.CV cs.MM 83%

Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation

Gang Liu, Hongyang Li, Zerui He, Shenjun Zhong

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05779 2024-02-09 cs.CY cs.CL cs.CV 83%

Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images

Kathleen C. Fraser, Svetlana Kiritchenko

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments To appear at EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12273 2023-12-20 cs.CV 83%

VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering

Chun-Mei Feng, Yang Bai, Tao Luo, Zhen Li, Salman Khan, Wangmeng Zuo, Xinxing Xu, Rick Siow Mong Goh, Yong Liu

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10613 2023-12-19 cs.CV 83%

p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models

Haoyuan Wu, Xinyun Zhang, Peng Xu, Peiyu Liao, Xufeng Yao, Bei Yu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by AAAI24. The first two authors contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02669 2023-12-19 cs.CV 83%

ConceptLab: Creative Concept Generation using VLM-Guided Diffusion Prior Constraints

Elad Richardson, Kfir Goldberg, Yuval Alaluf, Daniel Cohen-Or

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Project page: https://kfirgoldberg.github.io/ConceptLab/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07176 2023-10-12 cs.CV 83%

Improving mitosis detection on histopathology images using large vision-language models

Ruiwen Ding, James Hall, Neil Tenenholtz, Kristen Severson

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Submitted to IEEE ISBI 2024. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11593 2023-09-22 cs.CV 83%

Sentence Attention Blocks for Answer Grounding

Seyedalireza Khoshsirat, Chandra Kambhamettu

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11080 2023-09-21 cs.CV 83%

Visual Question Answering in the Medical Domain

Louisa Canepa, Sonit Singh, Arcot Sowmya

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments 8 pages, 7 figures, Accepted to DICTA 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03726 2023-09-08 cs.CV 83%

Interpretable Visual Question Answering via Reasoning Supervision

Maria Parelli, Dimitrios Mallis, Markos Diomataris, Vassilis Pitsikalis

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11662 2023-08-29 cs.CV 83%

VQA Therapy: Exploring Answer Differences by Visually Grounding Answers

Chongyan Chen, Samreen Anjum, Danna Gurari

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments IEEE/CVF International Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08088 2023-08-17 cs.CV cs.IR cs.MM 83%

Pro-Cap: Leveraging a Frozen Vision-Language Model for Hateful Meme Detection

Rui Cao, Ming Shan Hee, Adriel Kuek, Wen-Haw Chong, Roy Ka-Wei Lee, Jing Jiang

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Camera-ready for 23, ACM MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01239 2023-06-08 cs.CV 83%

MixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource Visual Question Answering

Jingjing Jiang, Nanning Zheng

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 13 pages, 6 figures, 9 tables. Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10046 2023-05-18 cs.CL cs.CV 83%

Probing the Role of Positional Information in Vision-Language Models

Philipp J. Rösch, Jindřich Libovický

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Findings of the Association for Computational Linguistics: NAACL 2022, pages 1031-1041, Seattle, United States. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06954 2023-05-09 cs.CV 83%

Correlation Information Bottleneck: Towards Adapting Pretrained Multimodal Models for Robust Visual Question Answering

Jingjing Jiang, Ziyi Liu, Nanning Zheng

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

Comments 20 pages, 6 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02297 2023-05-04 cs.CV 83%

Making the Most of What You Have: Adapting Pre-trained Visual Language Models in the Low-data Regime

Chuhan Zhang, Antoine Miech, Jiajun Shen, Jean-Baptiste Alayrac, Pauline Luc

专题命中 视觉问答 :visual language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00949 2022-12-02 cs.CV 83%

Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering

AJ Piergiovanni, Wei Li, Weicheng Kuo, Mohammad Saffar, Fred Bertsch, Anelia Angelova

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06122 2022-11-10 cs.CV cs.CL 83%

Discovering the Unknown Knowns: Turning Implicit Knowledge in the Dataset into Explicit Training Examples for Visual Question Answering

Jihyung Kil, Cheng Zhang, Dong Xuan, Wei-Lun Chao

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments Accepted to EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12085 2022-07-28 cs.CV 83%

UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling

Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, Lijuan Wang

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments ECCV 2022 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02334 2022-07-07 cs.CV 83%

Weakly Supervised Grounding for VQA in Vision-Language Transformers

Aisha Urooj Khan, Hilde Kuehne, Chuang Gan, Niels Da Vitoria Lobo, Mubarak Shah

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments To appear at ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.12533 2022-06-28 cs.CV 83%

From Shallow to Deep: Compositional Reasoning over Graphs for Visual Question Answering

Zihao Zhu

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03354 2022-06-10 cs.CL cs.CV 83%

cViL: Cross-Lingual Training of Vision-Language Models using Knowledge Distillation

Kshitij Gupta, Devansh Gautam, Radhika Mamidi

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICPR 2022; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01718 2022-06-06 cs.CV cs.CL 83%

A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge

Dustin Schwenk, Apoorv Khandelwal, Christopher Clark, Kenneth Marino, Roozbeh Mottaghi

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12616 2022-05-26 cs.CV 83%

Guiding Visual Question Answering with Attention Priors

Thao Minh Le, Vuong Le, Sunil Gupta, Svetha Venkatesh, Truyen Tran

专题命中 视觉问答 :visual question answering(title);visual reasoning(abstract);grounding(abstract);分类 cs.CV

Comments Preprint, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏