arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-25 至 2026-02-25 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2602.20853 2026-02-25 cs.CV 85%

On the Explainability of Vision-Language Models in Art History

关于视觉-语言模型在艺术史中的可解释性

Stefanie Schneider

机构 * Marburg University(马尔堡大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG 84%

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20878 2026-02-25 cs.AI 83%

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

通过结构化相关性图诊断视觉-语言模型中的因果推理

Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding

机构 * University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG 82%

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19117 2026-02-25 cs.CV 79%

Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models

保持符号投影布局:用于视觉-语言模型中以物体为中心的空间推理的符号投影布局

Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 SymPL通过将以物体为中心的空间推理转化为符号布局形式,提升视觉-语言模型在多视角场景下的推理性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-02-25 cs.CV 79%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20291 2026-02-25 cs.CV 74%

De-rendering, Reasoning, and Repairing Charts with Vision-Language Models

图表去渲染、推理与修复:基于视觉-语言模型

Valentin Bonas, Martin Sinnona, Viviana Siless, Emmanuel Iarussi

机构 * Universidad Torcuato Di Tella(托克托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会) Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 本文提出了一种结合图表去渲染、自动分析和迭代改进的框架,利用视觉-语言模型提供基于原则的可视化设计反馈,提升可视化质量和素养。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI 74%

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :VLM(title);分类 cs.AI

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01874 2026-02-25 cs.CV cs.AI 62%

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow:通过知识内化连接感知与推理以解决视觉数学问题

Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning Zhang, Yi Sun, Yi Yang, Hangjie Yuan

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 57%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏