arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 17 篇

2602.04712 2026-05-12 cs.CV cs.AI eess.IV 91%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 视觉问答 :MLLM(title,title_cn);visual question answering(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10739 2026-05-12 eess.IV cs.AI cs.CV 89%

Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

基于多模态大语言模型的遥感活动检测的时空感知

David F. Ramirez, Tim Overman, Kristen Jaskie, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司) Intelligence Advanced Research Projects Activity(智能高级研究计划局)

专题命中 视觉问答 :multimodal large language model(title);LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);visual question answering(abstract)

AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09384 2026-05-12 cs.CV cs.AI q-bio.QM 86%

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

LiteMedCoT-VL: 用于医疗视觉问答的参数高效适应

Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Innovation Engineering(创新工程学院) Macau University of Science and Technology(澳门科学技术大学) Department of Bioelectronics(生物电子系) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LiteMedCoT-VL,通过LoRA微调将大模型的推理过程转移到小模型,实现医疗视觉问答的高效部署,实验显示2B模型在准确率上超越4B模型。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 85%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 81%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 81%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 视觉问答 :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 79%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10772 2026-05-12 cs.CV cs.AI eess.IV 73%

Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition

迈向MSTAR自动目标识别的大型语言-视觉问答模型

David F. Ramirez, Tim L. Overman, Kristen Jaskie, Marv Kleine, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文探讨了将大型语言-视觉模型应用于遥感图像描述和视觉问答任务,特别是在合成孔径雷达图像中的自动目标识别挑战,通过参数高效微调实现了98%的准确率。

Comments Accepted to SPIE Defense + Commercial Sensing, Automatic Target Recognition XXXV

Journal ref Proc. SPIE 13463, Automatic Target Recognition XXXV, 134630D (29 May 2025);

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 73%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27629 2026-05-12 cs.AI 70%

WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习

Ke Xu, Zhongyuan Lian

机构 * Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司) Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出WaferSAGE框架,利用小规模视觉-语言模型进行晶圆缺陷视觉问答。通过合成数据生成和评分引导强化学习,解决半导体制造中的数据稀缺问题,展示小型模型在特定工业视觉理解中的优势。

Comments 16 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09906 2026-05-12 cs.AI cs.SD 70%

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰

Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) Tianjin University(天津大学) Huiyan Technology Company, Ltd.(慧颜科技有限公司) Chinese Academy of Sciences(中国科学院) Tencent(腾讯)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 62%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10791 2026-05-12 cs.AI 57%

PathISE: Learning Informative Path Supervision for Knowledge Graph Question Answering

PathISE: 通过信息路径监督学习知识图谱问答

Shengxiang Gao, Chao Lei, Jey Han Lau, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉问答 :grounding(abstract_cn);分类 cs.AI

AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10761 2026-05-12 cs.CV 57%

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 57%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10877 2026-05-12 cs.CL cs.IR 50%

Neural at ArchEHR-QA 2026: One Method Fits All: Unified Prompt Optimization for Clinical QA over EHRs

神经网络在ArchEHR-QA 2026中的应用:一种方法适用于所有:面向电子健康记录的临床问答的统一提示优化

Abrar Majeedi, Viswanatha Reddy Gajjala, Sai Prasanna Teja Reddy Bogireddy, Siddhant Rai

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出Neural1.5方法,通过分阶段的提示优化提升电子健康记录中的临床问答性能,实现多任务统一优化,展现系统性提示优化的有效性。

Comments Accepted to CL4Health @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10199 2026-05-12 cs.CL eess.AS 50%

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

LLMs在说话时应该如何倾听?对全双工语音对话中用户流路由的探讨

Hui Lu, Xueyuan Chen, Huimeng Wang, Shuhai Peng, Shiyin Kang, Xixin Wu, Zhiyong Wu

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 研究探讨了全双工语音对话中用户流路由对LLM的影响,通过对比通道融合与交叉注意力路由策略,发现通道融合在语义接地和问答性能上更优,但易受上下文干扰;交叉注意力路由更稳健,但问答表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏