arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2411.12287 2025-03-24 cs.CL 82%

CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model

Dongyoung Go, Taesun Whang, Chanhee Lee, Hwa-Yeon Kim, Sunghoon Park, Seunghwan Ji, Jinho Kim, Dongchan Kim, Young-Bum Kim

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract)

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14827 2025-03-05 cs.CV cs.AI cs.ET cs.LG 82%

Exploring Advanced Techniques for Visual Question Answering: A Comprehensive Comparison

Aiswarya Baby, Tintu Thankom Koshy

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, No figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02104 2024-12-04 cs.CL 82%

Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey

Yunkai Dang, Kaichen Huang, Jiahao Huo, Yibo Yan, Sirui Huang, Dongrui Liu, Mengxi Gao, Jie Zhang, Chen Qian, Kun Wang, Yong Liu, Jing Shao, Hui Xiong, Xuming Hu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13565 2024-11-13 cs.CV cs.AI cs.CL cs.LG 82%

Exploring Diverse Methods in Visual Question Answering

Panfeng Li, Qikai Yang, Xieming Geng, Wenjing Zhou, Zhicheng Ding, Yi Nian

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by 2024 5th International Conference on Electronic Communication and Artificial Intelligence

Journal ref Proceedings of the 2024 5th International Conference on Electronic Communication and Artificial Intelligence (ICECAI), 2024, pp. 681-685

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21220 2024-10-29 cs.CV cs.AI cs.IR cs.LG 82%

Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Zhixin Zhang, Yiyuan Zhang, Xiaohan Ding, Xiangyu Yue

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code is available at https://github.com/cnzzx/VSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16664 2024-10-24 cs.IR 82%

LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery

Yuyang Du, Kexin Chen, Yue Zhan, Chang Han Low, Tao You, Mobarakol Islam, Ziyu Guo, Yueming Jin, Guangyong Chen, Pheng-Ann Heng

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract)

Comments This paper has been accapted by 2024 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05131 2024-10-18 cs.LG cs.AI cs.CL cs.CV cs.CY 82%

RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models

Peng Xia, Kangyu Zhu, Haoran Li, Hongtu Zhu, Yun Li, Gang Li, Linjun Zhang, Huaxiu Yao

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19339 2024-10-08 cs.CL cs.AI cs.CV cs.LG 82%

Visual Question Decomposition on Multimodal Large Language Models

Haowei Zhang, Jianzhe Liu, Zhen Han, Shuo Chen, Bailan He, Volker Tresp, Zhiqiang Xu, Jindong Gu

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to EMNLP2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10108 2024-09-04 cs.CV cs.AI cs.LG 82%

Privacy-Aware Document Visual Question Answering

Rubèn Tito, Khanh Nguyen, Marlon Tobaben, Raouf Kerkouche, Mohamed Ali Souibgui, Kangsoo Jung, Joonas Jälkö, Vincent Poulain D'Andecy, Aurelie Joseph, Lei Kang, Ernest Valveny, Antti Honkela, Mario Fritz, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 35 pages, 12 figures, accepted for publication at the 18th International Conference on Document Analysis and Recognition, ICDAR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15050 2024-06-24 cs.LG cs.AI cs.CL cs.CV 82%

Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis

Lin Fan, Xun Gong, Cenyang Zheng, Yafei Ou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01402 2024-06-04 cs.CV cs.AI cs.LG 82%

Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering

Tao Li, Linjun Shou, Xuejun Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10226 2024-04-17 cs.AI cs.CL cs.CV cs.LG 82%

Find The Gap: Knowledge Base Reasoning For Visual Question Answering

Elham J. Barezi, Parisa Kordjamshidi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04514 2024-04-09 cs.CL 82%

Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models

Songtao Jiang, Yan Zhang, Chenyi Zhou, Yeying Jin, Yang Feng, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03574 2024-04-05 cs.CV cs.AI cs.LG 82%

TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices

Hasib-Al Rashid, Argho Sarkar, Aryya Gangopadhyay, Maryam Rahnemoonfar, Tinoosh Mohsenin

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a full paper by the tinyML Research Symposium 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14783 2024-03-25 cs.CV cs.AI cs.CL cs.LG cs.MA 82%

Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering

Bowen Jiang, Zhijun Zhuang, Shreyas S. Shivakumar, Dan Roth, Camillo J. Taylor

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments A full version of the paper will be released soon. The codes are available at https://github.com/bowen-upenn/Multi-Agent-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12728 2024-03-05 cs.CV cs.AI cs.CL cs.IR cs.LG 82%

Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering

Junnan Dong, Qinggang Zhang, Huachi Zhou, Daochen Zha, Pai Zheng, Xiao Huang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15933 2024-02-27 cs.CV cs.AI cs.CL cs.LG 82%

Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA

Wentao Mo, Yang Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments To be published in AAAI 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07384 2024-02-13 cs.CV cs.AI cs.LG 82%

Exploring Perceptual Limitation of Multimodal Large Language Models

Jiarui Zhang, Jinyi Hu, Mahyar Khayatkhoei, Filip Ilievski, Maosong Sun

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 14 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07023 2024-02-13 cs.CL cs.AI cs.CV cs.HC cs.LG 82%

Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations

Ankit Pal, Malaikannan Sankarasubbu

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint version, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16552 2023-09-29 cs.RO 82%

Semantic Scene Difference Detection in Daily Life Patroling by Mobile Robots using Pre-Trained Large-Scale Vision-Language Model

Yoshiki Obinata, Kento Kawaharazuka, Naoaki Kanazawa, Naoya Yamaguchi, Naoto Tsukamoto, Iori Yanokura, Shingo Kitagawa, Koki Shinjo, Kei Okada, Masayuki Inaba

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract)

Comments Accepted to 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15851 2023-08-31 cs.MM 82%

Prompting Vision Language Model with Knowledge from Large Language Model for Knowledge-Based VQA

Yang Zhou, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16713 2023-06-30 cs.CV cs.AI cs.LG 82%

Answer Mining from a Pool of Images: Towards Retrieval-Based Visual Question Answering

Abhirama Subramanyam Penamakuri, Manish Gupta, Mithun Das Gupta, Anand Mishra

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11033 2023-06-05 cs.CV cs.AI cs.LG 82%

Visual Question Answering: A Survey on Techniques and Common Trends in Recent Literature

Ana Cláudia Akemi Matsuki de Faria, Felype de Castro Bastos, José Victor Nogueira Alves da Silva, Vitor Lopes Fabris, Valeska de Sousa Uchoa, Décio Gonçalves de Aguiar Neto, Claudio Filipi Goncalves dos Santos

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 30 pages. arXiv admin note: text overlap with arXiv:2104.00926, arXiv:2110.02526, arXiv:2108.02059, arXiv:1908.01801 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09782 2023-05-31 cs.CV cs.AI cs.CL cs.LG 82%

Analysis of Visual Question Answering Algorithms with attention model

Param Ahir, Hiteishi M. Diwanji

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref GIT Journal of Engineering and Technology, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12191 2023-04-04 cs.CL cs.AI cs.CV cs.LG 82%

Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization

Aishwarya Agrawal, Ivana Kajić, Emanuele Bugliarello, Elnaz Davoodi, Anita Gergely, Phil Blunsom, Aida Nematzadeh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Findings of EACL 2023. Aishwarya, Ivana, Emanuele and Aida had equal first author contributions. Elnaz and Anita had equal contributions. Aida and Aishwarya had equal senior contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00690 2023-03-23 cs.CV cs.AI cs.CL cs.LG 82%

Generative Bias for Robust Visual Question Answering

Jae Won Cho, Dong-jin Kim, Hyeonggon Ryu, In So Kweon

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02982 2022-12-01 cs.CL 82%

Improving the Cross-Lingual Generalisation in Visual Question Answering

Farhad Nooralahzadeh, Rico Sennrich

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract)

Comments This work is accepted by the AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13242 2022-07-28 cs.CV cs.AI cs.CL cs.LG 82%

Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base

Jinyeong Chae, Jihie Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by the 2022 International Joint Conference on Neural Networks (IJCNN 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11053 2022-06-28 cs.CV cs.AI cs.LG cs.RO eess.IV 82%

Surgical-VQA: Visual Question Answering in Surgical Scenes using Transformer

Lalithkumar Seenivasan, Mobarakol Islam, Adithya K Krishna, Hongliang Ren

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code: https://github.com/lalithjets/Surgical_VQA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10448 2022-04-25 cs.CV cs.AI cs.CL cs.LG 82%

Hypergraph Transformer: Weakly-supervised Multi-hop Reasoning for Knowledge-based Visual Question Answering

Yu-Jung Heo, Eun-Sol Kim, Woo Suk Choi, Byoung-Tak Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏