arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 16 篇

2509.25944 2026-04-21 cs.AI 87%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24942 2026-04-21 cs.LG cs.AI cs.CL 84%

Finding Culture-Sensitive Neurons in Vision-Language Models

在视觉-语言模型中寻找文化敏感神经元

Xiutian Zhao, Rochelle Choenni, Rohit Saxena, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉-语言模型处理文化相关信息的神经元特性,通过CVQA基准验证文化敏感神经元的存在及其分布,提出ConAct方法提升识别效果。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20715 2026-04-21 cs.CV cs.CL 83%

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding

MUSEG:通过时间感知多段定位增强视频时间理解

Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Yang Liu

机构 * THUNLP-MT

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MUSEG通过引入时间感知多段定位,提升多模态大语言模型对视频时间信息的理解能力,通过定制化强化学习训练方案实现更全面的时间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 82%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 视觉问答 :visual reasoning(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16213 2026-04-21 cs.CV cs.AI cs.CL 82%

M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation

M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用

Jonggwon Park, Soobum Kim, Byungmu Yoon, Jihun Hyun, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 视觉问答 :grounding(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。

Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16930 2026-04-21 cs.CV cs.AI 81%

CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering

CoGR-MoE:基于概念引导的专家路由与一致选择和灵活推理的视觉问答

Xiyin Zeng, Yi Lu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 CoGR-MoE通过整合答案选项的语义信息指导专家选择,利用选项特征重新加权专家,生成判别性表示,用于选项比较和对比学习优化,提升视觉问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18320 2026-04-21 cs.CV cs.AI 79%

EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

EVE: 通过可执行视觉变换实现多模态大语言模型的可验证自进化

Yongrui Heng, Chaoya Jiang, Han Yang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EVE框架,通过可执行视觉变换实现多模态大语言模型的可验证自进化,解决伪标签方法和模板方法的不足,通过双策略架构和多维奖励系统提升模型自进化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16272 2026-04-21 cs.CV cs.AI cs.CL 79%

VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

VEFX-Bench:一个全面的通用视频编辑和视觉特效基准测试

Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu

机构 * Texas A\&M University(德克萨斯大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VEFX-Bench,基于VEFX-Dataset构建,用于标准化比较视频编辑系统,通过VEFX-Reward模型提升评估准确性,揭示当前模型在视觉合理性、指令遵循和编辑局部性方面的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17570 2026-04-21 cs.CV cs.AI 79%

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 73%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS 62%

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 62%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17405 2026-04-21 cs.AI 57%

STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

STRIDE: 用于检索增强多跳问答的策略迭代决策

Wei Chen, Lili Zhao, Zhi Zheng, HuiJun Hou, Tong Xu

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei Anhui China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 STRIDE通过分离战略规划、动态控制和 grounded 执行,解决多跳问答中实体早 Commit 和推理依赖缺失的问题,提升推理鲁棒性与准确性。

Comments Accepted by SIGIR 2026 Full Paper. The code repository is available at https://github.com/fanshu6hao/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 57%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16311 2026-04-21 cs.CL cs.AI cs.SI 57%

Multimodal Claim Extraction for Fact-Checking

多模态声明提取用于事实核查

Joycelyn Teo, Rui Cao, Zhenyun Deng, Zifeng Ding, Michael Sejr Schlichtkrull, Andreas Vlachos

机构 * Defence Science and Technology Agency, Singapore(新加坡国防科学与技术局) University of Cambridge, UK(英国剑桥大学) Queen Mary University of London, UK(英国伦敦大学学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出首个多模态社交媒体声明提取基准,评估了最先进的多模态大语言模型,在语义对齐、忠实度和去上下文化框架下发现基线模型难以建模修辞意图和上下文线索,引入意图感知框架MICE提升关键意图场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 57%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏