arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2503.21457 2025-03-28 cs.CV 77%

FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs

Xiaoqin Wang, Xusen Ma, Xianxu Hou, Meidan Ding, Yudong Li, Junliang Chen, Wenting Chen, Xiaoyang Peng, Linlin Shen

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08308 2025-03-12 cs.AI 77%

Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework

Zhuo Zhi, Chen Feng, Adam Daneshmend, Mine Orlu, Andreas Demosthenous, Lu Yin, Da Li, Ziquan Liu, Miguel R. D. Rodrigues

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09325 2025-02-14 cs.CV 77%

A Benchmark for Crime Surveillance Video Analysis with Large Models

Haoran Chen, Dong Yi, Moyan Cao, Chensen Huang, Guibo Zhu, Jinqiao Wang

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15411 2024-11-26 cs.CV 77%

FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity

Hang Hua, Qing Liu, Lingzhi Zhang, Jing Shi, Zhifei Zhang, Yilin Wang, Jianming Zhang, Jiebo Luo

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12384 2024-11-12 cs.CV 77%

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding

Xiang Li, Jian Ding, Mohamed Elhoseiny

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Accepted for publication at NeruIPS 2024 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17610 2024-10-31 cs.CL cs.CV 77%

ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue

Zhangpu Li, Changhong Zou, Suxue Ma, Zhicheng Yang, Chen Du, Youbao Tang, Zhenjie Cao, Ning Zhang, Jui-Hsin Lai, Ruei-Sung Lin, Yuan Ni, Xingzhi Sun, Jing Xiao, Jieke Hou, Kai Zhang, Mei Han

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07917 2024-08-26 cs.AI cs.CL 77%

DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation

Anna C. Doris, Daniele Grandi, Ryan Tomich, Md Ferdous Alam, Mohammadmehdi Ataei, Hyunmin Cheong, Faez Ahmed

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01081 2024-07-02 cs.CV cs.CL 77%

CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation

Yuxuan Wang, Yijun Liu, Fei Yu, Chen Huang, Kexin Li, Zhiguo Wan, Wanxiang Che

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17455 2024-06-17 cs.CV cs.CL 77%

CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers

Dachuan Shi, Chaofan Tao, Anyi Rao, Zhendong Yang, Chun Yuan, Jiaqi Wang

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

Comments ICML 2024. Code: https://github.com/sdc17/CrossGET

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09933 2024-04-16 cs.CV 77%

HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision

Siddhant Bansal, Michael Wray, Dima Damen

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Project Page: https://sid2697.github.io/hoi-ref/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17306 2024-04-02 cs.AI 77%

Visual Hallucination: Definition, Quantification, and Prescriptive Remediations

Anku Rani, Vipula Rawte, Harshad Sharma, Neeraj Anand, Krishnav Rajbangshi, Amit Sheth, Amitava Das

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06791 2023-12-07 cs.CV 77%

InfMLLM: A Unified Framework for Visual-Language Tasks

Qiang Zhou, Zhibin Wang, Wei Chu, Yinghui Xu, Hao Li, Yuan Qi

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07306 2023-11-14 cs.CV 77%

What Large Language Models Bring to Text-rich VQA?

Xuejing Liu, Wei Tang, Xinzhe Ni, Jinghui Lu, Rui Zhao, Zechao Li, Fei Tan

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05109 2023-10-10 cs.CV 77%

Lightweight In-Context Tuning for Multimodal Unified Models

Yixin Chen, Shuai Zhang, Boran Han, Jiaya Jia

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12223 2023-05-24 cs.CV 77%

What Makes for Good Visual Tokenizers for Large Language Models?

Guangzhi Wang, Yixiao Ge, Xiaohan Ding, Mohan Kankanhalli, Ying Shan

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14045 2023-03-02 cs.CL cs.CV 77%

Language Is Not All You Need: Aligning Perception with Language Models

Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao, Saksham Singhal, Shuming Ma, Tengchao Lv, Lei Cui, Owais Khan Mohammed, Barun Patra, Qiang Liu, Kriti Aggarwal, Zewen Chi, Johan Bjorck, Vishrav Chaudhary, Subhojit Som, Xia Song, Furu Wei

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.01916 2021-11-09 cs.CV 77%

Answer Questions with Right Image Regions: A Visual Attention Regularization Approach

Yibing Liu, Yangyang Guo, Jianhua Yin, Xuemeng Song, Weifeng Liu, Liqiang Nie

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments ACM TOMM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12304 2026-07-15 cs.CV cs.LG 新提交 76%

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况

Farrukh Rahman

机构 * Microsoft(微软) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :VLM(title);分类 cs.CV、cs.LG

AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。

Comments 9 pages, 11 pages supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 76%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16618 2025-09-23 cs.CV cs.AI 76%

Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery

Pengfei Hao, Hongqiu Wang, Shuaibo Li, Zhaohu Xing, Guang Yang, Kaishun Wu, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Imperial College London(帝国理工学院伦敦分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

Comments Early accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13836 2025-06-17 cs.LG cs.AI 76%

Quantifying Memorization and Parametric Response Rates in Retrieval-Augmented Vision-Language Models

Peter Carragher, Abhinand Jha, R Raghav, Kathleen M. Carley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05827 2024-04-04 cs.CL cs.AI cs.CV 76%

Hallucination Benchmark in Medical Visual Question Answering

Jinge Wu, Yunsoo Kim, Honghan Wu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2024 Tiny Papers(Notable)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04914 2023-11-28 cs.CV cs.AI cs.CL 76%

Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks

Avinash Madasu, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 视觉问答 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15325 2023-10-25 cs.CV cs.CL cs.LG 76%

LXMERT Model Compression for Visual Question Answering

Maryam Hashemi, Ghazaleh Mahmoudi, Sara Kodeiri, Hadi Sheikhi, Sauleh Eetemadi

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG

Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05863 2023-10-11 eess.AS cs.AI cs.CV cs.SD 76%

Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02489 2023-07-07 cs.CV cs.AI 76%

Visual Question Answering (VQA) on Images with Superimposed Text

Venkat Kodali, Daniel Berleant

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments To appear in: Proc. of the Future Technologies Conference (FTC) 2023, Nov. 2-3, San Francisco, pub. by Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01013 2023-06-27 cs.CV cs.AI cs.CL cs.MM 76%

Counterfactual Samples Synthesizing and Training for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Yulei Niu, Hanwang Zhang, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08739 2022-09-16 cs.CV cs.AI cs.CL cs.MM 76%

Rethinking Data Augmentation for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11574 2020-05-13 cs.CV cs.AI cs.CL 76%

TVQA+: Spatio-Temporal Grounding for Video Question Answering

Jie Lei, Licheng Yu, Tamara L. Berg, Mohit Bansal

专题命中 视觉问答 :grounding(title);分类 cs.CV、cs.AI

Comments ACL 2020 camera-ready (15 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02032 2020-04-07 cs.AI cs.CL cs.CV 76%

Generating Rationales in Visual Question Answering

Hammad A. Ayyubi, Md. Mehrab Tanjim, Julian J. McAuley, Garrison W. Cottrell

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏