arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-20 至 2026-04-20 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 16 篇

2604.16256 2026-04-20 cs.CV cs.CL 87%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10635 2026-04-20 cs.CV 85%

ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation

ChatENV: 一种用于传感器引导的环境监测和场景模拟的交互式视觉-语言模型

Hosam Elgendy, Ahmed Sharshar, Ahmed Aboeitta, Mohsen Guizani

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 视觉推理 :vision-language model(title);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 ChatENV通过整合卫星图像与真实传感器数据,实现环境变化的时序推理与假设验证,提升了环境监测的交互性和准确性。

Comments 11 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15332 2026-04-20 cs.HC cs.AI cs.CV cs.SE 81%

Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts

利用视觉-语言模型自动化生成碰撞图:多车道环形交叉口的案例研究

Xiao Lu, Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab, College of Engineering University of Georgia Athens(智能移动与基础设施实验室,工程学院,佐治亚大学亚特兰大分校)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究利用视觉-语言模型自动化生成碰撞图,针对多车道环形交叉口这一挑战性案例,提出三步提示框架和10项评估指标,发现GPT-4o在空间推理和数据对齐方面表现最佳,为生成式AI在工程可视化中的应用奠定基础。

Comments 16 pages, 5 figures, 3 tables

Journal ref Applied Computing and Intelligence, 2026, 6(1): 38-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 79%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15648 2026-04-20 cs.CL cs.CV 79%

HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

HyperGVL:超图理解与推理中大视觉-语言模型的基准测试与改进

Yanbin Wei, Chun Kang, Siwei Li, Haoxuan Che, Yang Chen, Hua Liu, Jian Liu, Zhuang Liu, Can Ouyang, Fei Xing, Lei Sha, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究) Beihang University(北航)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HyperGVL基准,评估12种先进LVLM在超图理解与推理中的能力,通过84,000个样本覆盖12种任务,引入可泛化的WiseHyGR路由器提升模型性能。

Comments Under Review; Opensource after accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15494 2026-04-20 cs.LG cs.CV 79%

ProtoTTA: Prototype-Guided Test-Time Adaptation

ProtoTTA:基于原型的测试时间适应

Mohammad Mahdi Abootorabi, Parvin Mousavi, Purang Abolmaesumi, Evan Shelhamer

机构 * University of British Columbia(不列颠哥伦比亚大学) Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ProtoTTA通过利用中间原型信号提升模型在分布偏移下的鲁棒性,同时恢复原型激活的语义聚焦,改进了标准输出熵最小化方法。

Comments ICLR 2026 Test-Time Updates (TTU) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14646 2026-04-20 cs.AI 77%

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

通过统一熵控制实现定向探索的强化学习

Chen Wang, Lai Wei, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Sun Yat-sen Univeristy(中山大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出UEC-RL框架,通过定向探索机制和稳定器解决强化学习中的熵崩溃问题,提升大模型推理性能。

Comments Accepted for publication in Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 76%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 70%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 62%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10562 2026-04-20 cs.CV cs.AI cs.CL cs.CY 62%

Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories

看见无形:图像分类到高级和抽象类别的调查

Delfina Sol Martinez Pandiani, Valentina Presutti

机构 * University of Bologna(博洛尼亚大学) University of Bologna Department of Computer Science(博洛尼亚大学计算机科学系) University of Bologna Department of Modern Languages, Literatures(博洛尼亚大学现代语言文学系) Centrum Wiskunde en Informatica(数学与信息学研究中心) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克奎恩特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文通过系统回顾高阶视觉理解的研究,探讨了抽象概念在自动图像分类中的处理,揭示了高阶视觉推理的挑战与机遇,强调了混合AI系统的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14967 2026-04-20 cs.CV cs.AI 62%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 62%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16024 2026-04-20 cs.MA cs.CV 57%

AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

AstroVLM:专家多智能体协作推理用于天体成像质量诊断

Yaohui Han, Tianshuo Wang, Zixi Zhao, Zhengchun Zhu, Shuo Ren, Yiru Wang, Rongliang Fu, Tinghuan Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出AstroVLM,通过多智能体协作推理解决复杂天体成像质量诊断问题,实验表明其在实际任务中优于所有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 57%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI 57%

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏