arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2410.18387 2025-04-08 cs.CV 83%

Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks

Lehan Wang, Haonan Wang, Honglong Yang, Jiaji Mao, Zehong Yang, Jun Shen, Xiaomeng Li

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14522 2025-03-28 cs.CV 83%

GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI

Tianbin Li, Yanzhou Su, Wei Li, Bin Fu, Zhe Chen, Ziyan Huang, Guoan Wang, Chenglong Ma, Ying Chen, Ming Hu, Yanjun Li, Pengcheng Chen, Xiaowei Hu, Zhongying Deng, Yuanfeng Ji, Jin Ye, Yu Qiao, Junjun He

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16868 2025-03-24 cs.CL cs.CV 83%

Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction

Mengsay Loem, Taiju Hosaka

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14140 2025-03-19 cs.CV 83%

Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding

Zining Wang, Tongkun Guan, Pei Fu, Chen Duan, Qianyi Jiang, Zhentao Guo, Shan Guo, Junfeng Luo, Wei Shen, Xiaokang Yang

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13891 2025-03-19 cs.CV cs.CL 83%

Where do Large Vision-Language Models Look at when Answering Questions?

Xiaoying Xing, Chia-Wen Kuo, Li Fuxin, Yulei Niu, Fan Chen, Ming Li, Ying Wu, Longyin Wen, Sijie Zhu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03554 2025-03-10 cs.CV 83%

Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset

Yingzi Ma, Jiongxiao Wang, Fei Wang, Siyuan Ma, Jiazhao Li, Jinsheng Pan, Xiujun Li, Furong Huang, Lichao Sun, Bo Li, Yejin Choi, Muhao Chen, Chaowei Xiao

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04543 2025-03-07 cs.CL cs.AI 83%

Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model

Wenke Huang, Jian Liang, Xianda Guo, Yiyang Fang, Guancheng Wan, Xuankun Rong, Chi Wen, Zekun Shi, Qingyun Li, Didi Zhu, Yanbiao Ma, Ke Liang, Bin Yang, He Li, Jiawei Shao, Mang Ye, Bo Du

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01264 2025-03-03 cs.CV 83%

Backdooring Vision-Language Models with Out-Of-Distribution Data

Weimin Lyu, Jiachen Yao, Saumya Gupta, Lu Pang, Tao Sun, Lingjie Yi, Lijie Hu, Haibin Ling, Chao Chen

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11288 2025-02-18 cs.CL cs.CV 83%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14179 2025-02-11 cs.CL cs.CV 83%

MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems

Zifeng Zhu, Mengzhao Jia, Zhihan Zhang, Lang Li, Meng Jiang

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments NAACL 2025, 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09996 2025-02-11 cs.CV cs.CL 83%

Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering

Rabiul Awal, Le Zhang, Aishwarya Agrawal

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Codes available at https://github.com/rabiulcste/vqazero

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09167 2025-01-17 cs.CV cs.RO 83%

Embodied Scene Understanding for Vision Language Models via MetaVQA

Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments for the project webpage, see https://metadriverse.github.io/metavqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02797 2025-01-17 cs.CL cs.AI 83%

PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging

Jinlong He, Pengfei Li, Gang Liu, Genrong He, Zhaolin Chen, Shenjun Zhong

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

Comments 12 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03939 2025-01-14 cs.CV cs.MM 83%

Visual question answering: from early developments to recent advances -- a survey

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Sunil Aryal, Imran Razzak, Hakim Hacid

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

Comments 20 papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08394 2025-01-03 cs.CV 83%

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, Jifeng Dai

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16771 2024-12-24 cs.CV 83%

SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization

Tan-Hanh Pham, Hoang-Nam Le, Phu-Vinh Nguyen, Chris Ngo, Truong-Son Hy

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00220 2024-12-24 cs.CV 83%

A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering

Xiaofei Huang, Hongfang Gong

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14215 2024-11-26 cs.CV 83%

@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology

Xin Jiang, Junwei Zheng, Ruiping Liu, Jiahang Li, Jiaming Zhang, Sven Matthiesen, Rainer Stiefelhagen

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by WACV 2025, project page: https://junweizheng93.github.io/publications/ATBench/ATBench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23828 2024-11-14 cs.CV 83%

Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection

Ke Li, Fuyu Dong, Di Wang, Shaofeng Li, Quan Wang, Xinbo Gao, Tat-Seng Chua

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18346 2024-11-14 cs.CL cs.CV 83%

Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective

Meiqi Chen, Yixin Cao, Yan Zhang, Chaochao Lu

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02722 2024-11-06 cs.CL cs.AI 83%

Multimodal Commonsense Knowledge Distillation for Visual Question Answering

Shuo Yang, Siwen Luo, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments AAAI 2025 (Accepted, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14200 2024-10-21 eess.IV cs.CL cs.CV 83%

E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model

Haoran Lai, Zihang Jiang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Weifu Lv, S. Kevin Zhou

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06420 2024-10-10 cs.CL cs.CV 83%

ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments

Sourjyadip Ray, Kushal Gupta, Soumi Kundu, Payal Arvind Kasat, Somak Aditya, Pawan Goyal

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12372 2024-10-08 cs.CV 83%

MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale

Xiaotang Gai, Chenyi Zhou, Jiaxiang Liu, Yang Feng, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04107 2024-10-08 cs.CV cs.CL 83%

TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions

Xingwei He, Qianru Zhang, A-Long Jin, Yuan Yuan, Siu-Ming Yiu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01089 2024-10-03 cs.CV 83%

FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks

Peiran Wu, Che Liu, Canyu Chen, Jun Li, Cosmin I. Bercea, Rossella Arcucci

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19232 2024-10-01 cs.CV 83%

TrojVLM: Backdoor Attack Against Vision Language Models

Weimin Lyu, Lu Pang, Tengfei Ma, Haibin Ling, Chao Chen

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18753 2024-09-30 cs.CV 83%

Enhancing Explainability in Multimodal Large Language Models Using Ontological Context

Jihen Amara, Birgitta König-Ries, Sheeba Samuel

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11007 2024-09-18 cs.CL cs.CV 83%

CAST: Cross-modal Alignment Similarity Test for Vision Language Models

Gautier Dagan, Olga Loginova, Anil Batra

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13898 2024-08-27 cs.CV 83%

Evaluating Attribute Comprehension in Large Vision-Language Models

Haiwen Zhang, Zixi Yang, Yuanzhi Liu, Xinran Wang, Zheqi He, Kongming Liang, Zhanyu Ma

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏