arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2409.14785 2024-12-10 cs.CL cs.CV 79%

Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models

Patrick Amadeus Irawan, Genta Indra Winata, Samuel Cahyawijaya, Ayu Purwarianti

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02452 2024-11-28 cs.CV eess.IV 79%

Goal-Oriented Semantic Communication for Wireless Visual Question Answering

Sige Liu, Nan Li, Yansha Deng, Tony Q. S. Quek

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11150 2024-11-19 cs.CV 79%

A Comprehensive Survey on Visual Question Answering Datasets and Algorithms

Raihan Kabir, Naznin Haque, Md Saiful Islam, Marium-E-Jannat

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10183 2024-11-18 cs.CV 79%

Visual question answering based evaluation metrics for text-to-image generation

Mizuki Miyamoto, Ryugo Morita, Jinjia Zhou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ISCAS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04933 2024-11-12 cs.CV 79%

SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering

Tianyu Yang, Yiyang Nan, Lisen Dai, Zhenwen Liang, Yapeng Tian, Xiangliang Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03386 2024-10-30 cs.CV 79%

Visual Robustness Benchmark for Visual Question Answering (VQA)

Md Farhan Ishmam, Ishmam Tashdeed, Talukder Asir Saadat, Md Hamjajul Ashmafee, Abu Raihan Mostofa Kamal, Md. Azam Hossain

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09428 2024-10-15 cs.AI cs.CL 79%

Declarative Knowledge Distillation from Large Language Models for Visual Question Answering Datasets

Thomas Eiter, Jan Hadl, Nelson Higuera, Johannes Oetsch

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments Presented at NeLaMKRR@KR, 2024 (arXiv:2410.05339)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15002 2024-10-07 cs.CL cs.CV 79%

CommVQA: Situating Visual Question Answering in Communicative Contexts

Nandita Shankar Naik, Christopher Potts, Elisa Kreiss

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EMNLP 2024 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00226 2024-10-02 cs.CV cs.CL 79%

Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training

Tongkun Su, Jun Li, Xi Zhang, Haibo Jin, Hao Chen, Qiong Wang, Faqin Lv, Baoliang Zhao, Yin Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19684 2024-10-01 cs.CV 79%

MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation

Lijian Xu, Hao Sun, Ziyu Ni, Hongsheng Li, Shaoting Zhang

专题命中 视觉问答 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10415 2024-09-10 cs.CV 79%

PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

Xiaoman Zhang, Chaoyi Wu, Ziheng Zhao, Weixiong Lin, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10237 2024-09-04 cs.CV cs.CL 79%

Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models

Songtao Jiang, Tuo Zheng, Yan Zhang, Yeying Jin, Li Yuan, Zuozhu Liu

专题命中 视觉问答 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17006 2024-09-02 cs.CV 79%

Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering

Su Hyeon Lim, Minkuk Kim, Hyeon Bae Kim, Seong Tae Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments ICIP Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16176 2024-08-30 cs.CV 79%

VLM4Bio: A Benchmark Dataset to Evaluate Pretrained Vision-Language Models for Trait Discovery from Biological Images

M. Maruf, Arka Daw, Kazi Sajeed Mehrab, Harish Babu Manogaran, Abhilash Neog, Medha Sawhney, Mridul Khurana, James P. Balhoff, Yasin Bakis, Bahadir Altintas, Matthew J. Thompson, Elizabeth G. Campolongo, Josef C. Uyeda, Hilmar Lapp, Henry L. Bart, Paula M. Mabee, Yu Su, Wei-Lun Chao, Charles Stewart, Tanya Berger-Wolf, Wasila Dahdul, Anuj Karpatne

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments 36 pages, 37 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05338 2024-08-14 cs.CV cs.CL 79%

Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models

Holy Lovenia, Wenliang Dai, Samuel Cahyawijaya, Ziwei Ji, Pascale Fung

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV

Comments Published in ALVR Workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21229 2024-08-01 cs.CV cs.CL 79%

Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration

Ngoc Son Nguyen, Van Son Nguyen, Tung Le

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted at the journal of Computers & Electrical Engineering (Received 8 March 2024, Revised 8 June 2024, Accepted 10 July 2024)

Journal ref Computers and Electrical Engineering 119 (2024) 109474

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15346 2024-07-23 cs.CV cs.CL cs.MM 79%

Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models

Wenbin An, Feng Tian, Jiahao Nie, Wenkai Shi, Haonan Lin, Yan Chen, QianYing Wang, Yaqiang Wu, Guang Dai, Ping Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12277 2024-07-18 cs.CL cs.AI 79%

Multimodal Reranking for Knowledge-Intensive Visual Question Answering

Haoyang Wen, Honglei Zhuang, Hamed Zamani, Alexander Hauptmann, Michael Bendersky

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15562 2024-07-18 cs.CV 79%

Fully Authentic Visual Question Answering Dataset from Online Communities

Chongyan Chen, Mengchen Liu, Noel Codella, Yunsheng Li, Lu Yuan, Danna Gurari

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09833 2024-07-17 cs.AI cs.MM cs.SD eess.AS 79%

SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering

Zhe Yang, Wenrui Li, Guanghui Cheng

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14906 2024-07-16 cs.CV 79%

AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Xiuyuan Chen, Yuan Lin, Yuchen Zhang, Weiran Huang

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08669 2024-07-12 cs.CV 79%

Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images

Lucrezia Tosato, Hichem Boussaid, Flora Weissgerber, Camille Kurtz, Laurent Wendling, Sylvain Lobry

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to IGARSS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19297 2024-06-28 cs.CV 79%

Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation

Malvina Nikandrou, Georgios Pantazopoulos, Ioannis Konstas, Alessandro Suglia

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12671 2024-06-18 cs.CV cs.CL 79%

Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering

Triet Minh Thai, Son T. Luu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments VLSP2022-EVJVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09203 2024-06-14 cs.CV 79%

Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns

Kaavya Rekanar, Martin Hayes, Ganesh Sistu, Ciaran Eising

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00231 2024-06-04 cs.CV cs.CL 79%

Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models

Lei Li, Yuqi Wang, Runxin Xu, Peiyi Wang, Xiachong Feng, Lingpeng Kong, Qi Liu

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Project page: https://mm-arxiv.github.io, Camera Ready Version of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11058 2024-06-04 cs.CV cs.CL 79%

II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering

Jihyung Kil, Farideh Tavazoee, Dongyeop Kang, Joo-Kyung Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13949 2024-05-24 cs.CV 79%

PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery

Runlong He, Mengya Xu, Adrito Das, Danyal Z. Khan, Sophia Bano, Hani J. Marcus, Danail Stoyanov, Matthew J. Clarkson, Mobarakol Islam

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12533 2024-05-22 cs.CV 79%

Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering

Hiba Maryam, Ling Fu, Jiajun Song, Tajrian ABM Shafayet, Qidi Luo, Xiang Bai, Yuliang Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by the International Conference on Document Analysis and Recognition (ICDAR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02233 2024-05-13 cs.CV 79%

MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation

Ling Yang, Zhanyu Wang, Zhenghao Chen, Xinyu Liang, Luping Zhou

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏