arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2402.03896 2025-06-11 cs.CV 79%

Multimodal Rationales for Explainable Visual Question Answering

Kun Li, George Vosselman, Michael Ying Yang

机构 * University of Twente(特文特大学) University of Bath(巴斯大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to CVPR workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14991 2025-06-03 cs.CV cs.CL 79%

ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla

Deeparghya Dutta Barua, Md Sakib Ul Rahman Sourove, Md Fahim, Fabiha Haider, Fariha Tanjim Shifat, Md Tasmim Rahman Adib, Anam Borhan Uddin, Md Farhan Ishmam, Md Farhad Alam

专题命中 视觉问答 :visual question answering(title);vision language model(abstract);分类 cs.CV

Comments Accepted in ECML PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11718 2025-06-02 cs.CL cs.CV 79%

"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models

Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song, Yingshui Tan, Xiang Li, Wenbo Su, Zhicheng Zheng, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV

Comments 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11051 2025-05-28 cs.CL cs.AI 79%

MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models

Jiahao Huo, Yibo Yan, Xu Zheng, Yuanhuiyi Lyu, Xin Zou, Zhihua Wei, Xuming Hu

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted as ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17625 2025-05-26 cs.CL cs.CV 79%

Enhancing Large Vision-Language Models with Layout Modality for Table Question Answering on Japanese Annual Securities Reports

Hayato Aida, Kosuke Takahashi, Takahiro Omi

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at IIAI AAI 2025, the 3rd International Conference on Computational and Data Sciences in Economics and Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16209 2025-05-26 cs.CV 79%

MedCFVQA: A Causal Approach to Mitigate Modality Preference Bias in Medical Visual Question Answering

Shuchang Ye, Usman Naseem, Mingyuan Meng, Dagan Feng, Jinman Kim

机构 * The University of Sydney(悉尼大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15928 2025-05-23 cs.CV cs.CL 79%

ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation

Tony Montes, Fernando Lozano

机构 * The Department of Electrical and Electronics Engineering(电气与电子工程系) Universidad de los Andes(亚利桑德大学)

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15401 2025-05-22 cs.CV 79%

Visual Question Answering on Multiple Remote Sensing Image Modalities

Hichem Boussaid, Lucrezia Tosato, Flora Weissgerber, Camille Kurtz, Laurent Wendling, Sylvain Lobry

机构 * LIPADE, Université Paris Cité, France(巴黎cité大学LIPADE研究所) ONERA, France(法国ONERA研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EARTHVISION 2025 8 pages, 1 page of supplementary material, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00479 2025-05-22 cs.CV 79%

Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach

Zhilin Zhang, Fangyu Wu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments To be published in 2025 6th International Conference on Computer Vision and Computational Intelligence (CVCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14319 2025-05-20 cs.CV cs.MM 79%

Scene-Text Grounding for Text-Based Video Question Answering

Sheng Zhou, Junbin Xiao, Xun Yang, Peipei Song, Dan Guo, Angela Yao, Meng Wang, Tat-Seng Chua

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08084 2025-05-14 cs.CV 79%

Visually Interpretable Subtask Reasoning for Visual Question Answering

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA(英伟达)

专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18681 2025-05-08 cs.CV cs.CL 79%

RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance

Chantal Pellegrini, Ege Özsoy, Benjamin Busam, Nassir Navab, Matthias Keicher

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted for publication at MIDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11733 2025-04-22 cs.CV 79%

DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment

Li Yu, Situo Wang, Wei Zhou, Moncef Gabbouj

机构 * School of Computer Science, Nanjing University of Information Science & Technology(信息科学技术南京大学计算机科学学院) Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology (CICAEET)(江苏省大气环境与装备技术协同创新中心) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学) Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,坦佩雷大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03337 2025-04-07 cs.CV 79%

QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning

Quanxing Xu, Ling Zhou, Xian Zhong, Feifei Zhang, Rubing Huang, Chia-Wen Lin

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03254 2025-04-07 cs.CV 79%

SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding

Yimin Wei, Aoran Xiao, Yexian Ren, Yuting Zhu, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18556 2025-03-25 cs.CV cs.CL 79%

Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models

Bin Li, Dehong Gao, Yeyuan Wang, Linbo Jin, Shanqing Yu, Xiaoyan Cai, Libin Yang

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15035 2025-03-20 cs.AI cs.RO 79%

GraspCorrect: Robotic Grasp Correction via Vision-Language Model-Guided Feedback

Sungjae Lee, Yeonjoo Hong, Kwang In Kim

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13016 2025-03-18 cs.CV 79%

Efficient Motion-Aware Video MLLM

Zijia Zhao, Yuqi Huo, Tongtian Yue, Longteng Guo, Haoyu Lu, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 视觉问答 :MLLM(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08474 2025-03-18 cs.CV cs.CL 79%

SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models

Haotian Xia, Zhengbang Yang, Junbo Zou, Rhys Tracy, Yuqing Wang, Chi Lu, Christopher Lai, Yanjun He, Xun Shao, Zhuoqing Xie, Yuan-fang Wang, Weining Shen, Hanjie Chen

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

Comments ICLR 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06492 2025-03-11 cs.CL cs.CV 79%

VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering

Yanling Wang, Yihan Zhao, Xiaodong Chen, Shasha Guo, Lixin Liu, Haoyang Li, Yong Xiao, Jing Zhang, Qi Li, Ke Xu

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12020 2025-03-06 cs.CV 79%

Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering

Jie Ma, Min Hu, Pinghui Wang, Wangchun Sun, Lingyun Song, Hongbin Pei, Jun Liu, Youtian Du

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16641 2025-02-25 cs.CV cs.CL cs.IR 79%

Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines

Xinwei Long, Zhiyuan Ma, Ermo Hua, Kaiyan Zhang, Biqing Qi, Bowen Zhou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12359 2025-02-19 cs.CV 79%

LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models

Zongyu Wu, Yuwei Niu, Hongcheng Gao, Minhua Lin, Zhiwei Zhang, Zhifang Zhang, Qi Shi, Yilong Wang, Sike Fu, Junjie Xu, Junjie Ao, Enyan Dai, Lei Feng, Xiang Zhang, Suhang Wang

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02385 2025-02-13 cs.CV cs.CL 79%

Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations

Kangyu Zhu, Ziyuan Qin, Huahui Yi, Zekun Jiang, Qicheng Lao, Shaoting Zhang, Kang Li

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14877 2025-01-28 cs.CL cs.CV 79%

DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images

Sami Baral, Li Lucy, Ryan Knight, Alice Ng, Luca Soldaini, Neil T. Heffernan, Kyle Lo

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV

Comments 19 pages, 10 figures, Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12697 2025-01-23 cs.CV 79%

Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering

Qian Tao, Xiaoyang Fan, Yong Xu, Xingquan Zhu, Yufei Tang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07109 2025-01-14 cs.CV 79%

The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering

Anupam Pandey, Deepjyoti Bodo, Arpan Phukan, Asif Ekbal

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15770 2025-01-14 cs.CV 79%

Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering

Zhicheng Zhao, Changfu Zhou, Yu Zhang, Chenglong Li, Xiaoliang Ma, Jin Tang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05690 2025-01-13 cs.CV cs.CL 79%

Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation

Daowan Peng, Wei Wei

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ICME2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12841 2024-12-18 cs.CL cs.AI 79%

Black-box Model Ensembling for Textual and Visual Question Answering via Information Fusion

Yuxi Xia, Kilm Zaporojets, Benjamin Roth

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments 15 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏