arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2502.07855 2025-06-18 cs.CV cs.AI cs.CL 81%

Vision-Language Models for Edge Networks: A Comprehensive Survey

Ahmed Sharshar, Latif U. Khan, Waseem Ullah, Mohsen Guizani

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈德布兹泽德人工智能大学)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.AI

Journal ref JIOT.2025.3579032

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23045 2025-05-30 cs.CV cs.AI 81%

Multi-Sourced Compositional Generalization in Visual Question Answering

Chuanhao Li, Wenbo Ye, Zhen Li, Yuwei Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19624 2025-05-27 cs.CV cs.AI 81%

Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat

Pusheng Xu, Xia Gong, Xiaolan Chen, Weiyi Zhang, Jiancheng Yang, Bingjie Yan, Meng Yuan, Yalin Zheng, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21000 2025-05-13 eess.IV cs.AI cs.CV 81%

Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering

Zhilin Zhang, Jie Wang, Zhanghao Qin, Ruiqi Zhu, Xiaoliang Gong

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments To be published in 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01903 2025-04-30 cs.CV cs.CL cs.LG 81%

Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering

Zhou Yu, Xuecheng Ouyang, Zhenwei Shao, Meng Wang, Jun Yu

机构 * Key Laboratory of Complex Systems Modeling and Simulation, the School of Computer Science, Hangzhou Dianzi University(复杂系统建模与仿真重点实验室、计算机科学学院、杭州电子大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子大学-ITMO联合学院) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院、合肥工业大学) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院、哈尔滨工业大学深圳校区)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments An extended journal version of our CVPR 2023 paper, which has been accepted at IEEE T-PAMI 2025. The original conference version can be referred to as the v1 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17073 2025-04-23 cs.CV cs.AI 81%

Path-RAG: Knowledge-Guided Key Region Retrieval for Open-ended Pathology Visual Question Answering

Awais Naeem, Tianhao Li, Huang-Ru Liao, Jiawei Xu, Aby M. Mathew, Zehao Zhu, Zhen Tan, Ajay Kumar Jaiswal, Raffi A. Salibian, Ziniu Hu, Tianlong Chen, Ying Ding

专题命中 视觉问答 :visual question answering(title);LLaVA(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of Machine Learning Research, Volume 259, 2025, pp. 735--746

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03135 2025-04-11 cs.CV cs.AI 81%

Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion

Junkai Zhang, Bin Li, Shoujun Zhou, Yue Du

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05575 2025-04-09 cs.CV cs.LG 81%

A Lightweight Large Vision-language Model for Multimodal Medical Images

Belal Alsinglawi, Chris McCarthy, Sara Webb, Christopher Fluke, Navid Toosy Saidy

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06667 2025-03-26 cs.CV cs.AI cs.CL 81%

Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video

Bin Li, Yixuan Weng, Bin Sun, Shutao Li

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13938 2025-03-24 cs.CV cs.AI 81%

ChatBEV: A Visual Language Model that Understands BEV Maps

Qingyao Xu, Siheng Chen, Guang Chen, Yanfeng Wang, Ya Zhang

专题命中 视觉问答 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21259 2025-03-07 cs.CV cs.AI 81%

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Han Bao, Yue Huang, Yanbo Wang, Jiayi Ye, Xiangqi Wang, Xiuying Chen, Yue Zhao, Tianyi Zhou, Mohamed Elhoseiny, Xiangliang Zhang

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02157 2025-03-05 cs.CV cs.AI 81%

MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20903 2025-03-05 cs.CV cs.AI 81%

WalkVLM:Aid Visually Impaired People Walking by Vision Language Model

Zhiqiang Yuan, Ting Zhang, Ying Deng, Jiapei Zhang, Yeshuang Zhu, Zexi Jia, Jie Zhou, Jinchao Zhang

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15589 2025-03-04 cs.CV cs.LG 81%

Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models

Amir Mohammad Karimi Mamaghan, Samuele Papa, Karl Henrik Johansson, Stefan Bauer, Andrea Dittadi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07594 2025-01-09 cs.CL cs.AI cs.CV cs.MM 81%

How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model

Shezheng Song, Xiaopeng Li, Shasha Li, Shan Zhao, Jie Yu, Jun Ma, Xiaoguang Mao, Weimin Zhang

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03795 2024-12-03 cs.CV cs.AI 81%

VQA$^2$: Visual Question Answering for Video Quality Assessment

Ziheng Jia, Zicheng Zhang, Jiaying Qian, Haoning Wu, Wei Sun, Chunyi Li, Xiaohong Liu, Weisi Lin, Guangtao Zhai, Xiongkuo Min

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 23 pages 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04118 2024-11-21 cs.CL cs.AI cs.LG 81%

Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?

Daniel P. Jeong, Saurabh Garg, Zachary C. Lipton, Michael Oberst

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments This version was published at EMNLP 2024 Main Conference as a Long Paper (Oral). See the extended version (arXiv:2411.08870) for additional results on QA tasks based on clinical notes and evaluations in the supervised fine-tuning regime

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07001 2024-11-07 cs.CL cs.AI cs.CV 81%

ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering

Yifan Wu, Lutao Yan, Leixian Shen, Yunhai Wang, Nan Tang, Yuyu Luo

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08798 2024-11-07 cs.AI cs.CV 81%

D3: Data Diversity Design for Systematic Generalization in Visual Question Answering

Amir Rahimi, Vanessa D'Amario, Moyuru Yamada, Kentaro Takemoto, Tomotake Sasaki, Xavier Boix

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments TMLR (https://openreview.net/forum?id=ZAin13msOp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00828 2024-11-05 cs.CV cs.LG 81%

Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data

Badr AlKhamissi, Yingtian Tang, Abdülkadir Gökce, Johannes Mehrer, Martin Schrimpf

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to BabyLM Challenge at CoNLL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00308 2024-11-05 cs.CV cs.AI 81%

From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities

Md Farhan Ishmam, Md Sakib Hossain Shovon, M. F. Mridha, Nilanjan Dey

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16662 2024-10-23 eess.IV cs.AI cs.CV 81%

Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective

Xiaolan Chen, Ruoyu Chen, Pusheng Xu, Weiyi Zhang, Xianwen Shang, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13120 2024-10-17 cs.CV cs.LG 81%

RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering

Yuduo Wang, Pedram Ghamisi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Journal ref IEEE Trans. Geosci. Remote Sens., vol. 62, pp. 1-13, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00977 2024-10-16 cs.CV cs.AI 81%

Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models

Rahul Thapa, Kezhen Chen, Ian Covert, Rahul Chalamala, Ben Athiwaratkun, Shuaiwen Leon Song, James Zou

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10184 2024-10-15 cs.CV cs.AI 81%

Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention

Ying Liu, Ge Bai, Chenji Lu, Shilong Li, Zhang Zhang, Ruifang Liu, Wenbin Guo

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Journal ref 2024 IEEE International Conference on Multimedia and Expo (ICME), Niagara Falls, ON, Canada, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16851 2024-10-07 cs.CL cs.AI cs.CV 81%

Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts

Aditya Sharma, Michael Saxon, William Yang Wang

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13592 2024-09-23 cs.CV cs.AI cs.CL 81%

YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models

Abhilash Nandy, Yash Agarwal, Ashish Patwa, Millon Madhur Das, Aman Bansal, Ankit Raj, Pawan Goyal, Niloy Ganguly

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Main (Long), 18 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00255 2024-09-04 cs.CV cs.AI cs.CL cs.GR cs.HC 81%

MAPWise: Evaluating Vision-Language Models for Advanced Map Queries

Srija Mukhopadhyay, Abhishek Rajgaria, Prerana Khatiwada, Vivek Gupta, Dan Roth

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 30 Pages, 46 Tables, 6 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04938 2024-08-31 cs.CV cs.AI 81%

Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering

Param Ahir, Hiteishi Diwanji

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07989 2024-08-16 cs.CV cs.AI 81%

IIU: Independent Inference Units for Knowledge-based Visual Question Answering

Yili Li, Jing Yu, Keke Gai, Gang Xiong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏