arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2604.10916 2026-04-20 cs.CV cs.AI 79%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10233 2026-04-14 cs.CV cs.AI 79%

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

将2D多模态大语言模型适应于3DCT图像分析

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所) Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出将2D多模态大语言模型适应于3DCT图像分析,设计Text-Guided Hierarchical MoE框架,采用两阶段训练策略提升医学报告生成和视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 79%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06665 2026-04-13 cs.CV cs.AI 79%

Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine

更好的眼睛,更好的思考:为何视觉链式推理在医学中失效

Yuan Wu, Zongxian Yang, Jiayu Qian, Songpan Gao, Guanxing Chen, Qiankun Li, Yu-An Huang, Zhi-An Huang

机构 * Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系) College of Computing and Data Science (CCDS), Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现链式推理在医学视觉问答中表现欠佳,提出通过感知锚定和描述 grounding 提升视觉 grounding 和跨模态对齐以改善性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 79%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 79%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13289 2026-02-17 cs.CV cs.AI 79%

Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs

评估后训练量化对多模态大语言模型可靠视觉问答的影响

Paul Jonas Kurz, Tobias Jan Wieczorek, Mohamed A. Abdelsalam, Rahaf Aljundi, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了后训练量化对多模态大语言模型可靠视觉问答的影响,提出通过选择器置信度估计器提升可靠性,并在不同量化方法中实现了效率与可靠性的最佳平衡。

Comments Accepted poster at the 1st Workshop on Epistemic Intelligence in Machine Learning (EIML) @ EURIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 79%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14770 2025-12-18 cs.CV cs.AI 79%

Improving VQA Reliability: A Dual-Assessment Approach with Self-Reflection and Cross-Model Verification

提升VQA可靠性:基于自我反思与跨模型验证的双评估方法

Xixian Wu, Yang Ou, Pengchao Tian, Zian Yang, Jielei Zhang, Peiyi Li, Longwen Gao

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DAVR框架,通过自我反思和跨模型验证提升VQA中VLM响应的可靠性,取得优异实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06020 2025-12-09 cs.CV cs.AI 79%

PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation

PrefGen: 多模态偏好学习用于偏好条件下的图像生成

Wenyi Mo, Tianyu Zhang, Yalong Bai, Ligong Han, Ying Ba, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) iN2X MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。

Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22341 2025-12-01 cs.CV cs.LG 79%

Unexplored flaws in multiple-choice VQA evaluations

多选式视觉问答评估中的未探索缺陷

Fabio Rosenthal, Sebastian Schmidt, Thorsten Graf, Thorsten Bagodonat, Stephan Günnemann, Leo Schwinn

机构 * Technical University of Munich(慕尼黑技术大学) Volkswagen AG(大众集团) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文揭示了多选式视觉问答评估中因提示格式变化导致的未探索偏差,指出其对MLLM评估结果的显著影响,并表明现有缓解策略无法有效应对这些新发现的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03127 2025-11-18 cs.CV cs.AI 79%

Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery

Sai Ma, Zhuang Li, John A Taylor

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18087 2025-10-28 cs.CV cs.AI 79%

CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays

Hyungyung Lee, Geon Choi, Jung-Oh Lee, Hangyul Yoon, Hyuk Gi Hong, Edward Choi

机构 * KAIST(韩国国立科学技术院) Seoul National University Hospital(首尔国立大学医院) Seoul Medical Center(首尔医疗中心)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19818 2025-10-23 cs.LG cs.AI cs.RO 79%

Semantic World Models

Jacob Berg, Chuning Zhu, Yanda Bao, Ishan Durugkar, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Sony AI(索尼人工智能)

专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24073 2025-08-27 cs.AI cs.CL cs.CV 79%

mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation

Chan-Wei Hu, Yueqi Wang, Shuo Xing, Chia-Ju Chen, Suofei Feng, Ryan Rossi, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Adobe Research(Adobe研究院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13428 2025-08-20 cs.CV cs.AI cs.MM 79%

Mitigating Easy Option Bias in Multiple-Choice Question Answering

Hao Zhang, Chen Li, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科学、技术及研究局,新加坡) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,科学、技术及研究局,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24371 2025-07-29 cs.CV cs.AI 79%

Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering

Md Intisar Chowdhury, Kittinun Aukkapinyo, Hiroshi Fujimura, Joo Ann Woo, Wasu Wasusatein, Fadoua Ghourabi

机构 * AWL, Inc.(AWL公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04621 2025-07-08 cs.LG cs.AI cs.NI 79%

Multimodal LLM Integrated Semantic Communications for 6G Immersive Experiences

Yusong Zhang, Yuxuan Sun, Lei Guo, Wei Chen, Bo Ai, Deniz Gunduz

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院,北京交通大学) School of Electrical and Electronic Engineering, Imperial College London(电子电气工程学院,帝国理工学院伦敦分校)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19688 2025-07-04 cs.CV cs.LG 79%

SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks

Kim-Celine Kahl, Selen Erkan, Jeremias Traub, Carsten T. Lüth, Klaus Maier-Hein, Lena Maier-Hein, Paul F. Jaeger

机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Medical Image Computing(德国癌症研究中心(DKFZ)海德堡,医学影像计算部门) Helmholtz Imaging, German Cancer Research Center (DKFZ), Heidelberg, Germany(海德堡影像技术,德国癌症研究中心(DKFZ),海德堡,德国) Faculty of Mathematics and Computer Science, University of Heidelberg, Germany(海德堡大学数学与计算机科学学院,德国) German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) German Cancer Research Center (DKFZ) Heidelberg, Interactive Machine Learning Group(德国癌症研究中心(DKFZ)海德堡,交互式机器学习小组) Pattern Analysis and Learning Group, Department of Radiation Oncology, Heidelberg University Hospital, Germany(放射肿瘤科,海德堡大学医院模式分析与学习小组,德国) National Center for Tumor Diseases (NCT) Heidelberg, Germany(海德堡国家肿瘤疾病中心(NCT),德国)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments TMLR 07/2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07044 2025-06-16 cs.CL cs.AI cs.CV 79%

Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning

LASA Team, Weiwen Xu, Hou Pong Chan, Long Li, Mahani Aljunied, Ruifeng Yuan, Jianyu Wang, Chenghao Xiao, Guizhen Chen, Chaoqun Liu, Zhaodonghui Li, Yu Sun, Junao Shen, Chaojun Wang, Jie Tan, Deli Zhao, Tingyang Xu, Hao Zhang, Yu Rong

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Technical Report, 53 pages, 25 tables, and 16 figures. Our webpage is https://alibaba-damo-academy.github.io/lingshu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04671 2025-04-09 cs.CV cs.AI 79%

Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios

Charles Corbière, Simon Roburin, Syrielle Montariol, Antoine Bosselut, Alexandre Alahi

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Project page: https://vita-epfl.github.io/DrivingVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17422 2025-02-25 cs.CV cs.AI cs.CL 79%

MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs

Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Published as a conference paper at ICLR 2025. Code at: https://github.com/saccharomycetes/mllms_know

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10994 2024-12-19 cs.CL cs.AI cs.CV cs.MM 79%

Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs

Dingjie Song, Wenjun Wang, Shunian Chen, Xidong Wang, Michael Guan, Benyou Wang

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09454 2024-10-15 cs.CV cs.LG 79%

Skipping Computations in Multimodal LLMs

Mustafa Shukor, Matthieu Cord

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Accepted at NeurIPS 2024 Workshop RBFM. Code: https://github.com/mshukor/ima-lmms

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05334 2024-08-13 cs.AI cs.CL cs.CV 79%

Revisiting Multi-Modal LLM Evaluation

Jian Lu, Shikhar Srivastava, Junyu Chen, Robik Shrestha, Manoj Acharya, Kushal Kafle, Christopher Kanan

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19679 2024-07-30 cs.CV cs.AI 79%

Harnessing Large Vision and Language Models in Agriculture: A Review

Hongyan Zhu, Shuai Qin, Min Su, Chengzhi Lin, Anjie Li, Junfeng Gao

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04106 2024-07-08 cs.AI cs.CL cs.CV 79%

MiniGPT-Med: Large Language Model as a General Interface for Radiology Diagnosis

Asma Alkhaldi, Raneem Alnajim, Layan Alabdullatef, Rawan Alyahya, Jun Chen, Deyao Zhu, Ahmed Alsinan, Mohamed Elhoseiny

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02842 2024-07-04 cs.CV cs.AI cs.CL 79%

MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis

Lei Chen, Feng Yan, Yujie Zhong, Shaoxiang Chen, Zequn Jie, Lin Ma

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02370 2024-04-04 cs.CV cs.AI cs.CL 79%

Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns

Yunsoo Kim, Jinge Wu, Yusuf Abdulle, Yue Gao, Honghan Wu

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏