arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-20 至 2026-04-20 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2604.15809 2026-04-20 cs.CV 85%

Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

对视觉-语言模型所见所感知进行对齐与适应性信息流

Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出通过调节信息流提升视觉-语言模型的感知能力,通过动态令牌方法确定视觉令牌的重要性,从而提高视觉问答、视觉定位等任务的性能。

Comments CVPR 2026. Project page: https://cxliu0.github.io/AIF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22278 2026-04-20 cs.CV 85%

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

FETAL-GAUGE:用于评估胎儿超声检查中视觉-语言模型的基准

Hussain Alasmawi, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Fetal-Gauge基准,用于评估视觉-语言模型在胎儿超声检查中的性能,包含42000张图像和93000个问题-答案对,揭示当前模型在临床任务中的性能差距,强调需领域适应的架构和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20503 2026-04-20 cs.CL 85%

Protecting multimodal large language models against misleading visualizations

保护多模态大语言模型免受误导性可视化的影响

Jonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系,德累斯顿技术大学及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系,鲁文大学) Department of Computer Science, KU Leuven(计算机科学系,鲁文大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究发现多模态大语言模型在面对误导性可视化时回答准确性显著下降,提出两种有效方法提升其处理能力,同时保持非误导性可视化下的准确性。

Comments Preprint. Code and data available at https://github.com/UKPLab/arxiv2025-misleading-visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27759 2026-04-20 cs.CV 79%

When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models

当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型

Chengyin Hu, Xuemeng Sun, Jiaju Han, Qike Zhang, Xiang Chen, Xin Wang, Yiwei Wei, Jiahua Long

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV

AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 79%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15808 2026-04-20 cs.CV cs.AI 79%

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

超越单帧:跨体积MRI的多帧空间接地推理

Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Georgetown University(乔治城大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 79%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16099 2026-04-20 cs.CV 77%

DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

DenTab:一个用于真实世界牙科估算表识别和视觉问答的数据集

Laziz Hamdi, Amine Tamasna, Thierry Paquet

机构 * LITIS, Normandy, France(诺曼底大学LITIS实验室) Malakoff Humanis, Paris, France(巴黎Malakoff Humanis机构)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 DenTab数据集包含2000张牙科估算表图像,用于评估表识别和视觉问答性能,包含2208个问题,涵盖检索、聚合和逻辑一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04300 2026-04-20 cs.CV cs.AI 62%

T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts

T2I-FactualBench:基于知识密集概念的文本到图像模型事实性评估基准

Ziwei Huang, Wanggui He, Quanyu Long, Yandi Wang, Haoyuan Li, Zhelun Yu, Fangxun Shu, Long Chan, Hao Jiang, Fei Wu, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出T2I-FactualBench,通过知识密集概念评估文本到图像模型的事实性,揭示当前SOTA模型在事实性上的不足。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27501-27524, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏