arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3132 篇

2206.15030 2022-07-01 cs.CL 50%

Modern Question Answering Datasets and Benchmarks: A Survey

Zhen Wang

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10255 2021-12-21 eess.SP 50%

Task-Oriented Multi-User Semantic Communications

Huiqiang Xie, Zhijin Qin, Xiaoming Tao, Khaled B. Letaief

专题命中 视觉问答 :visual question answering(abstract)

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.07357 2021-12-15 eess.SP 50%

Task-Oriented Multi-User Semantic Communications for VQA Task

Huiqiang Xie, Zhijin Qin, Geoffrey Ye Li

专题命中 视觉问答 :visual question answering(abstract)

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04014 2021-09-10 cs.CL 50%

Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering

Man Luo, Yankai Zeng, Pratyay Banerjee, Chitta Baral

专题命中 视觉问答 :visual question answering(abstract)

Comments accepted at EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.11210 2021-05-25 cs.CL 50%

StructuralLM: Structural Pre-training for Form Understanding

Chenliang Li, Bin Bi, Ming Yan, Wei Wang, Songfang Huang, Fei Huang, Luo Si

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted by ACL2021 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.06645 2021-04-15 cs.CL 50%

Jointly Learning Truth-Conditional Denotations and Groundings using Parallel Attention

Leon Bergen, Dzmitry Bahdanau, Timothy J. O'Donnell

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.00669 2020-11-03 cs.CL 50%

Reasoning Over History: Context Aware Visual Dialog

Muhammad A. Shah, Shikib Mehri, Tejas Srinivasan

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted to NLP Beyond Text workshop, EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03160 2020-10-08 cs.HC 50%

Vision Skills Needed to Answer Visual Questions

Xiaoyu Zeng, Yanan Wang, Tai-Yin Chiu, Nilavra Bhattacharya, Danna Gurari

专题命中 视觉问答 :visual question answering(abstract)

Comments To be published on Proceedings of the ACM on Human-Computer Interaction, Vol. 4, No. CSCW2, Article 149. Publication date: October 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01894 2020-04-07 cs.CL 50%

Evaluating Multimodal Representations on Visual Semantic Textual Similarity

Oier Lopez de Lacalle, Ander Salaberria, Aitor Soroa, Gorka Azkune, Eneko Agirre

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted in ECAI-2020, 8 pages, 6 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.03096 2018-08-17 cs.CL 50%

NMT-Keras: a Very Flexible Toolkit with a Focus on Interactive NMT and Online Learning

Álvaro Peris, Francisco Casacuberta

专题命中 视觉问答 :visual question answering(abstract)

Comments To appear at The Prague Bulletin of Mathematical Linguistics 111

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.09786 2018-05-25 cs.NE 50%

Hyperbolic Attention Networks

Caglar Gulcehre, Misha Denil, Mateusz Malinowski, Ali Razavi, Razvan Pascanu, Karl Moritz Hermann, Peter Battaglia, Victor Bapst, David Raposo, Adam Santoro, Nando de Freitas

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.08084 2017-03-24 cs.CL 50%

Multimodal Compact Bilinear Pooling for Multimodal Neural Machine Translation

Jean-Benoit Delbrouck, Stephane Dupont

专题命中 视觉问答 :visual question answering(abstract)

Comments Submitted to ICLR Workshop 2017

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4478 篇

2605.30745 2026-06-01 cs.CV 92%

Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness

Immuno-VLM:通过生成式语义抗体实现大型视觉-语言模型的开放世界可信赖性

Xiang Fang, Wanlong Fang, Wei Ji

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University(南京大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 针对大型视觉-语言模型在开放世界部署中因缺乏负面知识而将未知异常高置信度误分类为已知类别的“语义傲慢”问题,提出受生物免疫负选择启发的Immuno-VLM框架,利用大语言模型的生成推理主动产生“语义抗体”(近分布异常文本描述)来约束已知类决策空间,在ImageNet-1K和四个OOD基准上达到新最优。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV 92%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);grounding(title,abstract);visual reasoning(abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22409 2026-06-23 cs.CV cs.AI 新提交 92%

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)

专题命中 视觉推理 :VLM(title,title_cn);visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 92%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 视觉推理 :MLLM(title,title_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15651 2026-06-16 cs.CV 新提交 92%

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

自问式视觉语言模型:用于组合视觉推理的强化学习

Saraswathy Amjith

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV

AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 92%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :MLLM(title,title_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-07-21 cs.CV cs.AI 版本更新 92%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08477 2026-08-11 cs.CL 新提交 92%

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型

Juan S. Santillana

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn)

AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05405 2026-04-21 cs.CV 92%

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11631 2026-03-13 cs.AI cs.CV 91%

VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought

VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理

Eunsoo Lee, Jeongwoo Lee, Minki Hong, Jangho Choi, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title,abstract);vision-language model(abstract);InternVL(abstract)

AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。

Comments 30 pages, 21 figures, EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19340 2026-06-23 cs.RO 新提交 91%

ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

零样本长时程灵巧操作:基于多视图3D接地VLM推理

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract)

AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23724 2026-08-14 cs.CV cs.AI 版本更新 91%

Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference

聚焦推理,推断出异常:通过贝叶斯推理引导的聚焦VLM推理实现高速公路视频远场异常检测

Xiaowei Mao, Bowen Sui, Weijie Zhang, Yawen Yang, Shengnan Guo, Shilong Zhao, Jiaqi Lin, Tingrui Wu, Youfang Lin, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Key Laboratory of Big Data & Artificial Intelligence in Transportation, Ministry of Education(教育部交通运输大数据与人工智能重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence (2018)(北京市交通数据挖掘与具身智能重点实验室)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIBES框架,通过贝叶斯推理引导的聚焦VLM推理,解决远场目标异常检测中的注意力稀释和计算成本问题,提升检测准确性和实时效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05798 2026-07-08 cs.CV cs.AI 新提交 91%

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

回答前分割:用于多模态大语言模型视觉推理的像素定位

Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);MLLM(title);multimodal large language model(abstract)

AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00083 2026-06-02 cs.LG cs.AI cs.RO 91%

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

从演示到奖励:VLM奖励模型的测试时提示优化

Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) Catholic University of Leuven(鲁汶天主大学) Toyota Research Institute(丰田研究院) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Demo2Reward方法,利用少量专家演示在测试时优化VLM奖励模型的提示指令,减少假阳性并保持真阳性,无需额外训练即可提升下游策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22168 2026-05-22 cs.AI cs.LG 91%

Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability

衡量跨模态协同:VLM可解释性的一个基准

Joël Roman Ky, Salah Ghamizi, Maxime Cordy

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Synergistic Faithfulness作为衡量VLM跨模态协同的指标,解决了传统单模态评估方法在评估VLM可解释性时的不足,通过引入Shapley交互指数,实现了对多模态协同的准确评估,同时提升了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24339 2026-04-28 cs.CV cs.AI 91%

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :VLM(title,title_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01345 2026-05-12 cs.CV cs.AI cs.LG 91%

The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理

Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei, Jun Wang

机构 * The Hong Kong University of Science(香港科学与技术大学) University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。

Comments 27 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00106 2024-09-04 cs.CL cs.AI cs.CV cs.LG 91%

Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis

Aishik Nagar, Shantanu Jaiswal, Cheston Tan

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract);visual question answering(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏