arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2508.07414 2025-08-13 cs.CL cs.LG 85%

Grounding Multilingual Multimodal LLMs With Cultural Knowledge

Jean de Dieu Nyandwi, Yueqi Song, Simran Khanuja, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :grounding(title);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07918 2025-08-12 cs.CV 85%

RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering

Xing Zi, Jinghao Xiao, Yunxiao Shi, Xian Tao, Jun Li, Ali Braytee, Mukesh Prasad

机构 * School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院) SEDE, University of Technology Sydney(技术悉尼大学SEDE) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments This paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20756 2025-08-12 cs.CV cs.CL 85%

SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models

Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui

机构 * Peking University Beijing China Huawei Technologies Ltd. Beijing China Shanghai AI Laboratory Shanghai China Peking University Center for Machine Learning Research Beijing China Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China Peking University Huawei Technologies Ltd. Shanghai AI Laboratory

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02841 2025-08-06 cs.AI cs.IR 85%

A Multi-Agent System for Complex Reasoning in Radiology Visual Question Answering

Ziruo Yi, Jinyu Liu, Ting Xiao, Mark V. Albert

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02645 2025-08-05 cs.CV 85%

Evaluating Variance in Visual Question Answering Benchmarks

Nikitha SR

机构 * Media and Data Science Research Lab, Adobe(媒体与数据科学研究实验室,Adobe)

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted in ICCV 2025 Workshop on What's Next in Multimodal Foundational Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15435 2025-05-22 cs.CV 85%

TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models

Zeqing Wang, Shiyuan Zhang, Chengpei Tang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

Comments 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21505 2025-03-28 cs.CL cs.CV 85%

Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving

Yue Li, Meng Tian, Zhenyu Lin, Jiangtong Zhu, Dechang Zhu, Haiqiang Liu, Zining Wang, Yueyi Zhang, Zhiwei Xiong, Xinhai Zhao

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12799 2025-03-25 cs.CV cs.MM 85%

Grounded Chain-of-Thought for Multimodal Large Language Models

Qiong Wu, Xiangcong Yang, Yiyi Zhou, Chenxin Fang, Baiyang Song, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉问答 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15892 2025-03-21 cs.CV 85%

UMIT: Unifying Medical Imaging Tasks via Vision-Language Models

Haiyang Yu, Siyang Yi, Ke Niu, Minghan Zhuo, Bin Li

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14941 2025-03-20 cs.CV 85%

UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation

Qihui Zhang, Munan Ning, Zheyuan Liu, Yanbo Wang, Jiayi Ye, Yue Huang, Shuo Yang, Xiao Chen, Yibing Song, Li Yuan

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06003 2025-03-11 cs.CV 85%

Integrating Frequency-Domain Representations with Low-Rank Adaptation in Vision-Language Models

Md Azim Khan, Aryya Gangopadhyay, Jianwu Wang, Robert F. Erbacher

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17331 2025-02-17 cs.CV 85%

Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering

Zeqing Wang, Wentao Wan, Qiqing Lao, Runmeng Chen, Minjie Lang, Xiao Wang, Keze Wang, Liang Lin

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01720 2025-01-27 cs.CV 85%

Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models

Guosheng Zhang, Keyao Wang, Haixiao Yue, Ajian Liu, Gang Zhang, Kun Yao, Errui Ding, Jingdong Wang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to AAAI2025(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14150 2025-01-17 cs.CV 85%

DriveLM: Driving with Graph Visual Question Answering

Chonghao Sima, Katrin Renz, Kashyap Chitta, Li Chen, Hanxue Zhang, Chengen Xie, Jens Beißwenger, Ping Luo, Andreas Geiger, Hongyang Li

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to ECCV 2024 as Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20742 2024-12-31 cs.CV 85%

UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models

Yujie Li, Wenjia Xu, Guangzuo Li, Zijian Yu, Zhiwei Wei, Jiuniu Wang, Mugen Peng

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20213 2024-12-20 cs.CV 85%

VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis

Chao Pang, Xingxing Weng, Jiang Wu, Jiayu Li, Yi Liu, Jiaxing Sun, Weijia Li, Shuai Wang, Litong Feng, Gui-Song Xia, Conghui He

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05679 2024-12-11 cs.CV 85%

RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts

Xu Liu, Zhouhui Lian

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01445 2024-11-05 cs.CV 85%

A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning

Fei Wang, Chengcheng Chen, Hongyu Chen, Yugang Chang, Weiming Zeng

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20717 2024-10-29 cs.CV 85%

Face-MLLM: A Large Face Perception Model

Haomiao Sun, Mingjie He, Tianheng Lian, Hu Han, Shiguang Shan

专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16983 2024-10-23 cs.AI 85%

Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models

Zhijie Tan, Xu Chu, Weiping Li, Tong Mo

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09733 2024-10-15 cs.CV 85%

MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models

Hang Hua, Yunlong Tang, Ziyun Zeng, Liangliang Cao, Zhengyuan Yang, Hangfeng He, Chenliang Xu, Jiebo Luo

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04521 2024-10-08 cs.CV 85%

MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration

Lai Wei, Wenkai Wang, Xiaoyu Shen, Yu Xie, Zhihao Fan, Xiaojin Zhang, Zhongyu Wei, Wei Chen

专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 21 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16494 2024-09-26 cs.CV cs.CL 85%

A Unified Hallucination Mitigation Framework for Large Vision-Language Models

Yue Chang, Liqiang Jing, Xiaopeng Zhang, Yue Zhang

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15125 2024-09-24 cs.CV 85%

Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation

Manu Gaur, Darshan Singh S, Makarand Tapaswi

专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments ECCV 2024 Workshop EVAL-FoMo; Project Page: https://katha-ai.github.io/projects/detect-describe-discriminate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15768 2024-06-25 cs.CV 85%

MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception

Guanqun Wang, Xinyu Wei, Jiaming Liu, Ray Zhang, Yichi Zhang, Kevin Zhang, Maurice Chong, Shanghang Zhang

专题命中 视觉问答 :MLLM(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16862 2024-06-24 cs.CV cs.CL 85%

TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones

Zhengqing Yuan, Zhaoxu Li, Weiran Huang, Yanfang Ye, Lichao Sun

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICML workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13294 2024-06-21 cs.MM cs.LG 85%

Enhancing Cross-Prompt Transferability in Vision-Language Models through Contextual Injection of Target Tokens

Xikang Yang, Xuehai Tang, Fuqing Zhu, Jizhong Han, Songlin Hu

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04640 2024-03-08 cs.CV 85%

CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios

Qilang Ye, Zitong Yu, Rui Shao, Xinyu Xie, Philip Torr, Xiaochun Cao

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16033 2024-02-13 cs.CV cs.CL 85%

Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs

Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 20 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02503 2024-02-07 cs.CV cs.CL 85%

GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering

Ziyu Ma, Shutao Li, Bin Sun, Jianfei Cai, Zuxiang Long, Fuyan Ma

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏