arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2511.21339 2025-11-27 cs.CV cs.AI 84%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11206 2025-11-17 cs.CV cs.LG 84%

Questioning the Stability of Visual Question Answering

Amir Rosenfeld, Neta Glazer, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 视觉问答 :visual question answering(title);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 84%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05577 2025-11-11 cs.LG cond-mat.mtrl-sci cs.AI cs.CL 84%

Fine-Tuning Vision-Language Models for Multimodal Polymer Property Prediction

An Vuong, Minh-Hao Van, Prateek Verma, Chen Zhao, Xintao Wu

机构 * Department of EECS University of Arkansas(电子工程与科学系 亚拉荷加大学) Department of CS Baylor University(计算机科学系 基尔默大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10449 2025-11-04 cs.CV cs.AI 84%

CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding

Hongyong Han, Wei Wang, Gaowei Zhang, Mingjie Li, Yi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Technology Innovation Center for South China Sea Remote Sensing, Surveying and Mapping Collaborative Application, Ministry of Natural Resources(自然资源部南海遥感测绘协同应用技术创新中心) South China Sea Development Research Institute, Ministry of Natural Resources(自然资源部南海发展研究 institute) Inspur Computer Technology Co., Ltd(Inspur 计算机技术有限公司) Shandong Key Laboratory of Advanced Computing(山东先进计算重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16411 2025-10-17 cs.CV cs.LG 84%

Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression

Sreetama Sarkar, Yue Che, Alex Gavin, Peter A. Beerel, Souvik Kundu

机构 * University of Southern California(美国南加州大学) Intel Labs(英特尔实验室) Harvard-Westlake School(哈佛-韦斯利学校)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11034 2025-10-13 cs.LG cs.AI cs.CL 84%

CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models

Aneesh Komanduri, Karuna Bhaila, Xintao Wu

机构 * Department of Electrical Engineering and Computer Science University of Arkansas(电气工程与计算机科学系 奎萨克大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025 Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00047 2025-10-02 cs.CV cs.AI 84%

Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations

Sihao Ding, Santosh Vasa, Aditi Ramadwar

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研究与开发北美)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025 workshop on Regulatable ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17127 2025-09-30 cs.CV cs.LG 84%

Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts

Michal Golovanevsky, William Rudman, Michael Lepori, Amir Bar, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) University of Tübingen(图宾根大学)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20871 2025-09-26 cs.CV cs.AI 84%

SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering

Yan Zhang, Jiaqing Lin, Miao Zhang, Kui Xiao, Xiaoju Hou, Yue Zhao, Zhifei Li

机构 * School of Computer Science, Hubei University, Wuhan, China(湖北大学计算机学院) Hubei Key Laboratory of Big Data Intelligent Analysis and Application (Hubei University)(湖北大数据智能分析与应用重点实验室) Key Laboratory of Intelligent Sensing System and Security (Hubei University)(智能传感系统与安全重点实验室) Institute of Vocational Education, Guangdong Industry Polytechnic University(广东行业职业大学职业教育学院) Shandong Police College(山东警察学院)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI

Comments ACCEPTED as a FULL PAPER for the Research Track at International Conference on Database Systems for Advanced Applications 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16633 2025-09-23 cs.CV cs.AI cs.CL 84%

When Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMs

Abhirama Subramanyam Penamakuri, Navlika Singh, Piyush Arora, Anand Mishra

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱诺尔)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to EMNLP (Main) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17860 2025-08-26 cs.CV cs.AI 84%

AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering

Kang Zeng, Guojin Zhong, Jintao Cheng, Jin Yuan, Zhiyong Li

机构 * Hunan University(湖南大学) South China Normal University(华南师范大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14784 2025-08-19 cs.CV cs.AI 84%

LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering

Xinxin Dong, Baoyun Peng, Haokai Ma, Yufei Wang, Zixuan Dong, Fei Hu, Xiaodong Wang

专题命中 视觉问答 :grounding(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10872 2025-08-19 cs.CV cs.AI cs.ET 84%

V-RoAst: Visual Road Assessment. Can VLM be a Road Safety Assessor Using the iRAP Standard?

Natchapon Jongwiriyanurak, Zichao Zeng, June Moh Goo, Xinglei Wang, Ilya Ilyankou, Kerkritt Sriroongvikrai, Nicola Christie, Meihui Wang, Huanfa Chen, James Haworth

机构 * University College London(伦敦大学学院) Chulalongkorn University(朱拉隆梭大学)

专题命中 视觉问答 :VLM(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 84%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13405 2025-07-21 cs.CV cs.LG 84%

COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark

Ishant Chintapatla, Kazuma Choji, Naaisha Agarwal, Andrew Lin, Hannah You, Charles Duong, Kevin Zhu, Sean O'Brien, Vasu Sharma

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20964 2025-07-09 cs.CV cs.AI 84%

Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering

Zhengxuan Zhang, Yin Wu, Yuyu Luo, Nan Tang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13860 2025-07-08 cs.CV cs.AI 84%

Domain Adaptation of VLM for Soccer Video Understanding

Tiancheng Jiang, Henry Wang, Md Sirajus Salekin, Parmida Atighehchian, Shinan Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 视觉问答 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 5 figures, accepted to the 11th IEEE International Workshop on Computer Vision in Sports (CVSports) at CVPR 2025; supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08174 2025-07-01 cs.CL cs.AI cs.LG cs.MM 84%

Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models

Qingni Wang, Tiantian Geng, Zhiyuan Wang, Teng Wang, Bo Fu, Feng Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学) Southern University of Science and Technology(南方科技大学) University of Birmingham(伯明翰大学) The University of Hong Kong(香港大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICLR 2025 Spotlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08704 2025-06-30 cs.CV cs.AI 84%

Beyond the Hype: A dispassionate look at vision-language models in medical scenario

Yang Nan, Huichi Zhou, Xiaodan Xing, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(生物工程部门和Imperial-X,帝国理工学院伦敦分校) GSK, Artificial Intelligence and Machine Learning(GSK,人工智能与机器学习) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里托尼医院) School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19217 2025-06-25 cs.CV cs.AI 84%

MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports

Sunggu Kyung, Hyungbin Park, Jinyoung Seo, Jimin Sung, Jihyun Kim, Dongyeong Kim, Wooyoung Jo, Yoojin Nam, Sangah Park, Taehee Kwon, Sang Min Lee, Namkug Kim

机构 * Department of Biomedical Engineering, University of Ulsan College of Medicine(生物医学工程系,釜山大学医学院)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 5 figures, submitted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06242 2025-06-09 cs.CV cs.AI 84%

Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models

Zahra Babaiee, Peyman M. Kiasari, Daniela Rus, Radu Grosu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02615 2025-06-04 cs.CV cs.AI 84%

Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models

Safaa Abdullahi Moallim Mohamud, Minjin Baek, Dong Seog Han

机构 * Center for ICT and Automotive Convergence, Kyungpook National University(信息与汽车融合研究中心,庆北国立大学) School of Electronic and Electrical Engineering, Kyungpook National University(电子电气工程学院,庆北国立大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19031 2025-05-27 cs.CV cs.AI 84%

Medical Large Vision Language Models with Multi-Image Visual Ability

Xikai Yang, Juzheng Miao, Yuchen Yuan, Jiaze Wang, Qi Dou, Jinpeng Li, Pheng-Ann Heng

机构 * Dept. of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13973 2025-05-21 cs.CL cs.AI cs.CV 84%

Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models

Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu, Xiwen Chen, Abolfazl Razi, Aris Sotiras, Yi Su, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St.Louis(华盛顿大学圣路易斯分校) Banner Alzheimer’s Institute(Banner阿尔茨海默病研究所)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11326 2025-05-19 cs.CV cs.AI 84%

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models

Keunwoo Peter Yu, Joyce Chai

机构 * Computer Science and Engineering Division University of Michigan(计算机科学与工程系大学米歇尔大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06152 2025-05-12 cs.CV cs.AI 84%

MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks

Wenqi Zeng, Yuqi Sun, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing, School of Computer Science, Fudan University(上海智能信息处理关键实验室,计算机科学学院,复旦大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12705 2025-05-09 cs.CL cs.AI cs.CV 84%

WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines

Genta Indra Winata, Frederikus Hudi, Patrick Amadeus Irawan, David Anugraha, Rifki Afina Putri, Yutong Wang, Adam Nohejl, Ubaidillah Ariq Prathama, Nedjma Ousidhoum, Afifa Amriani, Anar Rzayev, Anirban Das, Ashmari Pramodya, Aulia Adila, Bryan Wilie, Candy Olivia Mawalim, Ching Lam Cheng, Daud Abolade, Emmanuele Chersoni, Enrico Santus, Fariz Ikhwantri, Garry Kuwanto, Hanyang Zhao, Haryo Akbarianto Wibowo, Holy Lovenia, Jan Christian Blaise Cruz, Jan Wira Gotama Putra, Junho Myung, Lucky Susanto, Maria Angelica Riera Machin, Marina Zhukova, Michael Anugraha, Muhammad Farid Adilazuarda, Natasha Santosa, Peerat Limkonchotiwat, Raj Dabre, Rio Alexander Audino, Samuel Cahyawijaya, Shi-Xiong Zhang, Stephanie Yulia Salim, Yi Zhou, Yinxuan Gui, David Ifeoluwa Adelani, En-Shiun Annie Lee, Shogo Okada, Ayu Purwarianti, Alham Fikri Aji, Taro Watanabe, Derry Tanti Wijaya, Alice Oh, Chong-Wah Ngo

机构 * Capital One SEACrowd NAIST ITB UofT KAIST JAIST Cardiff University Independent HKUST SMU Masakhane University of Lagos HK PolyU Boston University Columbia University MBZUAI Monash University UCSB Tokyo Tech AI Singapore NICT Cohere McGill MILA Canada CIFAR AI Chair Ontario Tech

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

Comments Best Theme Paper at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11038 2025-04-16 cs.CV cs.AI 84%

QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Jiansheng Chen, Xingwu Sun, Zhanhui Kang, Yu Wang

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by NAACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01049 2025-04-03 cs.CV cs.LG 84%

SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering

Bingxin Li

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏