arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-02 至 2026-06-02 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 22 篇

2606.02463 2026-06-02 cs.CV cs.AI 85%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21397 2026-06-02 cs.CV cs.AI cs.CL cs.LG 85%

Understanding the Effects of Distractors on Reasoning Vision-Language Models

理解干扰项对推理视觉语言模型的影响

Jiyun Bae, Hyunjong Ok, Sangwoo Mo, Jaeho Lee

机构 * Pohang University of Science and Technology (POSTECH)(坡山科学技术大学(POSTECH))

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过构建包含语义和数值维度干扰项的视觉问答数据集Idis,研究视觉干扰项如何影响视觉语言模型的测试时缩放行为,发现视觉干扰项以与文本干扰项根本不同的方式降低准确率而不增加推理长度,并提出简单提示策略缓解干扰项驱动的预测。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01591 2026-06-02 cs.CV cs.LG 84%

TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning

TLG: 通过源标注重建和类别目标推理实现视频问答的时间逻辑基础

Ali Alavi

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视觉问答 :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 提出TLG三阶段系统,通过重建动作时间线、解析问题为时间逻辑程序并确定性执行,结合强视觉语言模型和前沿推理模型,将视频问答准确率从46.9%提升至71.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00123 2026-06-02 cs.CV cs.AI cs.LG 80%

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距

Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Anzhen Hospital(北京安贞医院) Beihang University(北航) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02171 2026-06-02 cs.CV 79%

InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

InsightVQA: 高维情感认知视觉问答基准

Shiyu Wang, Ziyu Liu, Chaoyi Yu, Yujie Yin, Zhongqian Mao, Jing Chen, Jiaqi Song, Yunshi Lan, Yan Wang

机构 * East China Normal University(东华师范大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 为解决现有基准仅关注情感识别而缺乏深层认知推理的问题,提出大规模层次化视觉问答数据集InsightVQA,包含725K问答对,并构建评估基准InsightVQA-Bench和基线模型InsightNet。

Comments 16 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14065 2026-06-02 cs.AI 79%

REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment

REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突

Kai Ye, Xianwei Mao, Sheng Zhou, Zirui Shao, Ye Mo, Liangliang Liu, Haikuan Huang, Bin Li, Jiajun Bu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 79%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00829 2026-06-02 cs.CV 77%

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge

正确的推理策略即是一切:面向EgoCross挑战的近乎无需训练的领域感知推理

Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 视觉问答 :VLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对EgoCross挑战中源受限场景下多模态大模型在领域偏移严重的自我中心视频问答任务上表现不佳的问题,提出一种领域感知推理策略,通过为四个目标领域分别设计不同的输入、提示和答案映射流程,在不进行额外训练的情况下显著提升基线模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01132 2026-06-02 cs.CV 70%

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

HakushoBench:来自政府白皮书的日语图表VQA基准

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) NII(日本学术振兴会) NII LLMC(日本学术振兴会LLMC)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 利用政府白皮书构建日语图表VQA基准HakushoBench,包含2053张图像和人工标注问答对,评估视觉语言模型对图表的深度理解。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02522 2026-06-02 cs.CV cs.AI 62%

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Southeast University(东南大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02168 2026-06-02 cs.CV cs.LG 62%

Disentanglement-Based Equivariant Learning for Compositional VQA

基于解耦的等变学习用于组合式VQA

Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu

机构 * IEEE Publication Technology Group(IEEE出版技术组) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Engineering Research Center of Sustainable Urban Intelligence Transportation, Ministry of Education, China(可持续智慧城市交通工程研究中心,中华人民共和国教育部) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统(MAIS)国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 提出DEAL框架,通过因果干预解耦视觉和文本概念,并利用等变约束增强组合推理能力,在CLEVR-CoGenT和GQA-SGL上超越现有方法。

Comments Accepted by IEEE Transactions on Multimedia

Journal ref IEEE Trans. Multimedia, vol. 27, pp. 8160-8173, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12263 2026-06-02 cs.AI cs.LG 62%

InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning

InPhyRe 发现:大型多模态模型在归纳物理推理中表现不佳

Gautam Sreekumar, Vishnu Naresh Boddeti

机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 提出 InPhyRe 基准测试,通过合成视频中的碰撞事件预测任务,评估大型多模态模型在未见物理定律下的归纳物理推理能力,发现其依赖有限参数知识、受语言偏差影响且忽略视觉输入。

Comments Accepted to TMLR. 53 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL 62%

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 62%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01106 2026-06-02 cs.CV 57%

Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

基于结构化视觉证据的时间证据路由用于TimeLogicQA

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) Opus AI Research(Opus AI研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出视觉证据路由流水线,分离感知与符号时间推理,通过结构化视觉证据和确定性时间规则在TimeLogicQA上达到81.8 AvgAcc。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01044 2026-06-02 cs.CV 57%

Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA

Ask4VG: 用于减少医学VQA中先验驱动答案的风险感知问题选择

Xiaorong Zhu, Qiang Li, Zibo Xu, Weijie Wang, Weizhi Nie

机构 * School of Microelectronics, Tianjin University, Tianjin 300072, China(天津大学电子工程学院,天津 300072,中国) DISI, University of Trento, Trento, Italy(特伦托大学DISI研究所,意大利特伦托) School of Electrical and Information Engineering, Tianjin University, Tianjin 300072, China(天津大学电气与信息工程学院,天津 300072,中国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出Ask4VG框架,通过反事实视觉探测估计问题引发的幻觉风险,并重排问题改写以选择更依赖图像证据的问题,从而减少医学VQA中的先验驱动答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00825 2026-06-02 cs.CV cs.ET cs.HC cs.MA 57%

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

SuperMemory-VQA:面向长期记忆的自我中心视觉问答基准

Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, James Fort, Richard Newcombe, Hyo Jin Kim, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) Meta Project(Meta项目)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出SuperMemory-VQA数据集,包含52.9小时AI眼镜录制的日常活动及4853个多选问答对,用于评估AI助手在长期记忆任务上的表现,发现现有系统可靠性不足。

Comments 34 pages, 21 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00602 2026-06-02 cs.CV 57%

ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training

ASAP: 基于解剖感知语义自适应预训练的医学体素表示学习

Rongsheng Wang, Fenghe Tang, Zihang Jiang, Yingtai Li, Xu Zhang, Haoran Lai, Wenxin Ma, Wei Wei, Zhiyang He, Xiaodong Tao, Rui Yan, Qingsong Yao, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE) Lab, YRD-RIGHT, USTC Suzhou Institute for Advanced Research(医学影像、机器人、分析计算与学习(MIRACLE)实验室,YRD-RIGHT,中国科学技术大学苏州研究院) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) Biomedical Basic Research Center (BBRC) of Jiangsu Province(江苏省生物医学基础研究中心) Department of Radiology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(放射科,中国科学技术大学第一附属医院,生命科学与医学系,中国科学技术大学) Anhui IFLYTEK CO., Ltd(安徽科大讯飞股份有限公司) School of Medicine, Stanford University(医学院,斯坦福大学) State Key Laboratory of Precision and Intelligent Chemistry, Hefei, Anhui, China(安徽省精密与智能化学重点实验室,合肥,安徽,中国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出ASAP框架,通过解剖感知知识注入、语义自适应对齐与融合,从胸部CT扫描和放射学报告中学习可迁移且可解释的体素表示,在15个数据集和22个下游任务上取得最先进性能。

Comments MICCAI2025 extention

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 57%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26028 2026-06-02 cs.CV 57%

Learning to Trim: End-to-End Causal Graph Pruning with Dynamic Anatomical Feature Banks for Medical VQA

学习修剪:基于动态解剖特征库的端到端因果图剪枝用于医学视觉问答

Zibo Xu, Qiang Li, Weizhi Nie, Yuting Su

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出可学习因果修剪(LCT)框架,通过动态解剖特征库(DAFB)和可微修剪模块,在端到端优化中抑制虚假相关,增强因果信号,提升医学VQA的鲁棒性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01631 2026-06-02 cs.MM 50%

TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering

TimeLogic Challenge @ CVPR 2026: 强多模态大语言模型遇见面向时序逻辑视频问答的证据搜索智能体

Zhaoyang Xu, Xusheng He, Wei Liu, Zhenyang Li, Jianlong Wu

专题命中 视觉问答 :vision-language model(abstract)

AI总结 提出一种基于证据搜索智能体的无训练时序逻辑视频问答方法,通过多粒度采样工具包和分类引导策略,在TimeLogic测试集上达到77.13 AvgAcc。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00203 2026-06-02 cs.CL 50%

DeSQ: Decomposition-based SPARQL Query Generation

DeSQ:基于分解的SPARQL查询生成

Papa Abdou Karim Karou Diallo, Aditya Sharma, Neshat Elhami Fard, Amal Zouaq

机构 * LAMA-WeST Mila – Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 提出DeSQ框架,通过将复杂问题分解为原子约束并映射为SPARQL片段,再组装成完整查询,在五个基准测试中四个超越现有方法,并增强鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏