arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-20 至 2026-05-20 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2605.19307 2026-05-20 cs.CV 90%

MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估

Quanxing Xu, Yuhao Tian, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang, Chia-Wen Lin

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20165 2026-05-20 cs.CV 85%

CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

CaMo:基于摄像机运动的视觉-语言模型评估与训练

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jianxu Shangguan, Cheng-Yen Yang, Jenq-Neng Hwang

机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。

Comments Code and model available at https://github.com/hsiangwei0903/CaMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20158 2026-05-20 cs.CV cs.AI cs.CL 81%

Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

重新思考用于大视觉语言模型胸部X光推理中的视觉归因

Guangzhi Xiong, Qiao Jin, Sanchit Sinha, Zhiyong Lu, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) National Institutes of Health(美国国立卫生研究院)

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对大视觉语言模型在胸部X光推理中视觉归因的可靠性问题,提出了一种因果评估框架,通过反事实编辑保留仅由专家标注区域验证的X光-VQA样本,以确定模型预测的因果责任区域。通过11种归因方法、6种开源LVLMs和两种输出模式,发现现有归因方法往往无法识别LVLMs所使用的证据。为此,本文提出MedFocus,一种基于概念的归因方法,通过不平衡最优传输局部化具有临床意义的解剖区域,并通过针对性干预测量其对模型输出的因果效应,显著优于现有方法,推动医疗LVLMs的更可信归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11024 2026-05-20 cs.CV cs.AI 81%

Does AI See like Art Historians? Interpreting How Vision Language Models Recognize Artistic Style

AI 是否能像艺术史家一样看?解析视觉语言模型如何识别艺术风格

Marvin Limpijankit, Milad Alshomary, Yassin Oulad Daoud, Amith Ananthram, Tim Trombley, Emily L. Spratt, Anna Filonenko, Hannah Pivo, Elias Stengel-Eskin, Mohit Bansal, Noam M. Elcott, Kathleen McKeown

机构 * Columbia University, Department of Computer Science(哥伦比亚大学计算机科学系) Columbia University, Department of Art History & Archaeology(哥伦比亚大学艺术史与考古系) University of Texas at Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉问答 :vision language model(title);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉语言模型(VLMs)在识别艺术风格方面的机制,通过跨学科合作,分析VLMs如何预测艺术风格,并评估其与艺术史家判断艺术风格的标准的一致性。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18853 2026-05-20 cs.LG cs.CV cs.DC 73%

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

INAR-VL:面向边缘-云视觉-语言推断的输入感知路由

Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

机构 * TU Wien(维也纳技术大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本文提出INAR-VL,一种轻量级的边缘-云路由系统,用于多模态推断的两级部署。该系统通过轻量级的图像和文本复杂度信号指导路由和模型选择,在本地执行简单查询,将复杂查询卸载到云端,从而在延迟、能耗和准确性之间取得平衡。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏