arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2511.13892 2025-11-19 cs.AI 83%

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems

Badhan Chandra Das, Md Tasnim Jawad, Md Jueal Mia, M. Hadi Amini, Yanzhao Wu

机构 * KFSCIS, Florida International University(凯斯-西储大学信息科学学院) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院) Learning for InterDependent Networks Laboratory (solid lab)(依赖网络学习实验室)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18041 2025-11-17 cs.CV 83%

NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning

Sahil Shah, S P Sharan, Harsh Goel, Minkyu Choi, Mustafa Munir, Manvik Pasula, Radu Marculescu, Sandeep Chinchali

专题命中 视觉问答 :grounding(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00942 2025-11-13 cs.CL cs.AI eess.SP 83%

anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding

Haitao Li, Ziyu Li, Yiheng Mao, Ziyi Liu, Zhoujian Sun, Zhengxing Huang

专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00504 2025-11-11 cs.CV 83%

VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning

Dang H. Nguyen, Hieu H. Pham, Hao T. Nguyen, Hieu H. Pham

机构 * College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(Vin大学) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) Vietnam National Cancer Hospital(越南国家癌症医院) The Computer Vision and Medical AI Lab(计算机视觉与医学人工智能实验室)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments ISBI submission. Contains 5 pages, 2 figures, and 6 tables. Code & data: https://huggingface.co/datasets/Dangindev/VinDR-CXR-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00916 2025-11-04 cs.CV 83%

Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs

Yan Shu, Chi Liu, Robin Chen, Derek Li, Bryan Dai

机构 * Ubiquant(乌比量化)

专题命中 视觉问答 :visual reasoning(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11295 2025-11-03 cs.CV 83%

Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering

Jian Lan, Zhicheng Liu, Udo Schlegel, Raoyuan Zhao, Yihong Liu, Hinrich Schütze, Michael A. Hedderich, Thomas Seidl

机构 * University of Munich(慕尼黑大学) Munich Center of Machine Learning(慕尼黑机器学习中心)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 83%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02328 2025-10-06 cs.CL cs.AI cs.MA 83%

AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering

Ziqing Wang, Chengsheng Mao, Xiaole Wen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学) Microsoft(微软公司)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25696 2025-10-01 cs.LG cs.CL eess.SP 83%

Can VLM Pseudo-Labels Train a Time-Series QA Model That Outperforms the VLM?

Takuya Fujimura, Kota Dohi, Natsuo Yamashita, Yohei Kawaguchi

机构 * Nagoya University(名古屋大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16628 2025-09-23 cs.CV 83%

Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning

Janak Kapuriya, Anwar Shaikh, Arnav Goel, Medha Hira, Apoorv Singh, Jay Saraf, Sanjana, Vaibhav Nauriyal, Avinash Anand, Zhengkui Wang, Rajiv Ratn Shah

机构 * Indraprastha Institute of Information Technology, Delhi(印度德里印度理工学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 83%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13773 2025-09-17 cs.CV cs.CL 83%

Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions

Pu Jian, Donglei Yu, Wen Yang, Shuo Ren, Jiajun Zhang

专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV

Comments ACL2025 Main (SAC Highlight Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17659 2025-08-14 cs.CV 83%

See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering

Junjie Wang, Yunhan Tang, Yijie Wang, Zhihao Yuan, Huan Wang, Yangfan He, Bin Li

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments We are withdrawing this preprint because it is undergoing a major revision and restructuring. We feel that the current version does not convey our core contributions and methodology with sufficient clarity and accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07023 2025-08-12 cs.CV 83%

MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering

Jingwei Peng, Jiehao Chen, Mateo Alejandro Rojas, Meilin Zhang

机构 * Shaanxi University of Technology(陕西理工大学) Technological University of Peru(秘鲁技术大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04059 2025-08-07 cs.CV 83%

Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models

Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao, Limeng Qiao, Lin Ma, Tingting Jiang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07631 2025-07-31 cs.LG cs.CL 83%

OWLViz: An Open-World Benchmark for Visual Question Answering

Thuy Nguyen, Dang Nguyen, Hoang Nguyen, Thuan Luong, Long Hoang Dang, Viet Dac Lai

机构 * Posts and Telecommunications Institute of Technology, Viet Nam(越南电信技术研究所) Adobe Research, USA(Adobe研究) University of Maryland, USA(美国马里兰大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.LG

Comments 8 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21596 2025-07-16 cs.CL cs.AI cs.IR 83%

Evaluating Multimodal Large Language Models on Educational Textbook Question Answering

Hessa A. Alawwad, Anas Zafar, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

机构 * Faculty of Computing and Information Technology(计算与信息科技学院) King Abdulaziz University(阿卜杜勒阿齐兹大学) FAST School of Computing(快速计算学院) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Center of Research Excellence in AI and Data Science(人工智能与数据科学卓越研究中心)

专题命中 视觉问答 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06183 2025-07-09 cs.CV 83%

Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling

Prahitha Movva, Naga Harshita Marupaka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Southern California(南加州大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20566 2025-06-26 cs.RO cs.CV 83%

HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction

Zhonghao Shi, Enyu Zhao, Nathaniel Dennler, Jingzhen Wang, Xinyang Xu, Kaleen Shrestha, Mengxue Fu, Daniel Seita, Maja Matarić

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering University of Southern California, Los Angeles CA 90089, USA

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to the 19th International Symposium on Experimental Robotics (ISER 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16450 2025-06-23 cs.CV 83%

How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?

Giuseppe Lando, Rosario Forte, Giovanni Maria Farinella, Antonino Furnari

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10286 2025-06-13 cs.CV 83%

HalLoc: Token-level Localization of Hallucinations for Vision Language Models

Eunkyu Park, Minyeong Kim, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04459 2025-06-12 cs.CV 83%

Question-Aware Gaussian Experts for Audio-Visual Question Answering

Hongyeob Kim, Inyoung Jung, Dayoon Suh, Youjia Zhang, Sangmin Lee, Sungeun Hong

机构 * Sungkyunkwan University(成均馆大学) Purdue University(普渡大学)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments CVPR 2025. Code is available at https://github.com/AIM-SKKU/QA-TIGER

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05765 2025-06-12 cs.CV cs.CL 83%

Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?

Taiga Shinozaki, Tomoki Doi, Amane Watahiki, Satoshi Nishida, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Keio University(庆应大学) CiNet, NICT(NICT CiNet) Riken(理化学研究所)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV

Comments To appear in the Proceedings of the 47th Annual Meeting of the Cognitive Science Society (COGSCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11985 2025-06-12 cs.CV 83%

MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering

Jingqun Tang, Qi Liu, Yongjie Ye, Jinghui Lu, Shu Wei, Chunhui Lin, Wanqing Li, Mohamad Fitri Faiz Bin Mahmood, Hao Feng, Zhen Zhao, Yangfan He, Kuan Lu, Yanjie Wang, Yuliang Liu, Hao Liu, Xiang Bai, Can Huang

机构 * ByteDance Inc.(字节跳动公司) Huazhong University of Science and Technology(华中科技大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16469 2025-06-02 cs.CL cs.CV 83%

Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration

ChaeHun Park, Yujin Baek, Jaeseok Kim, Yu-Jung Heo, Du-Seong Chang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) KT Corporation(KT公司) Sogang Univ.(ソガン大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments ACL 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19354 2025-05-27 cs.CL cs.CV 83%

GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance

Mohammad Mahdi Moradi, Sudhir Mudur

机构 * Concordia University(康科迪亚大学)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16674 2025-05-23 cs.CV 83%

Zero-Shot Anomaly Detection in Battery Thermal Images Using Visual Question Answering with Prior Knowledge

Marcella Astrid, Abdelrahman Shabayek, Djamila Aouada

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted in EUSIPCO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15564 2025-05-22 cs.CV 83%

TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving

Hossein Hassani, Soodeh Nikan, Abdallah Shami

机构 * Western University(滑铁卢大学)

专题命中 视觉问答 :visual question answering(title);vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21309 2025-05-01 cs.CV 83%

An Evaluation of a Visual Question Answering Strategy for Zero-shot Facial Expression Recognition in Still Images

Modesto Castrillón-Santana, Oliverio J Santana, David Freire-Obregón, Daniel Hernández-Sosa, Javier Lorenzo-Navarro

机构 * SIANI - Universidad de Las Palmas de Gran Canaria Spain(SIANI - 拉帕尔马群岛大加那利大学)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04659 2025-04-10 cs.CV 83%

ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models

Ziyue Wang, Chi Chen, Fuwen Luo, Yurui Dong, Yuanchi Zhang, Yuzhuang Xu, Xiaolong Wang, Peng Li, Yang Liu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏