arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2604.08615 2026-04-13 cs.CV cs.AI 79%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12184 2026-04-10 cs.CV cs.AI 79%

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CompoDistill:多模态大语言模型中基于注意力的知识蒸馏用于组合推理

Jiwan Kim, Kibum Kim, Sangwoo Seo, Chanyoung Park

机构 * KAIST(韩国科学技术院)

专题命中 视觉推理 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CompoDistill,通过显式对齐学生与教师模型的视觉注意力,提升多模态大语言模型的组合推理能力,同时保持视觉问答任务的性能。

Comments ICLR'26, Project Page : https://ptkjw1997.github.io/CompoDistill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06250 2026-04-09 cs.CV cs.AI 79%

DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs

DISSECT:诊断视觉结束和语言先验开始的位置在科学视觉-语言模型中

Dikshant Kukreja, Kshitij Sah, Karan Goyal, Mukesh Mohania, Vikram Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 DISSECT通过12000个问题诊断科学VLMs中视觉与语言先验的界限,揭示了视觉信息提取与下游推理之间的差距,发现开源模型在自身描述推理中表现更优,而闭源模型无此差距,表明跨模态能力的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13998 2026-04-07 cs.RO cs.AI cs.LG 79%

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

Embodied-R1:强化的具身推理用于通用机器人操作

Yifu Yuan, Haiqin Cui, Yaoting Huang, Yibin Chen, Fei Ni, Zibin Dong, Pengyi Li, Yan Zheng, Hongyao Tang, Jianye Hao

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Embodied-R1,通过引入指向作为统一的中间表示,结合强化微调方法,实现通用机器人操作中的具身推理,展示了在多个基准测试中的卓越性能和零样本泛化能力。

Comments Embodied-R1 technical report v2; Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28610 2026-04-01 cs.CV cs.AI cs.CL 79%

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

ResAdapt:面向高效多模态推理的自适应分辨率

Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Ben Wang, Jun Zhao, Kun Xu, Kang Liu

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ResAdapt通过自适应输入分辨率框架,在保持高空间分辨率的同时提升多模态推理效率,尤其在压缩条件下显著提升性能。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 79%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视觉推理 :visual language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01607 2026-03-12 cs.AI cs.LG 79%

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

CARE:迈向多模态医学推理中的临床问责的证据基础代理框架

Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)

专题命中 视觉推理 :VLM(abstract);visual language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24385 2026-03-03 cs.CV cs.AI 79%

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应

Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu, Jiaxuan Lin, Jingrong Wang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory(湖北珞珈实验室) School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25390 2026-03-03 cs.CV cs.AI 79%

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, Ding Zhao

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13324 2026-02-17 cs.CV cs.AI cs.RO 79%

Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge

构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理

Jesse Barkley, Abraham George, Amir Barati Farimani

机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。

Comments 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 79%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 79%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 79%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09049 2026-01-23 cs.AI cs.CV cs.RO 79%

VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning

VIKI-R: 通过强化学习协调具身多智能体合作

Li Kang, Xiufeng Song, Heng Zhou, Yiran Qin, Jie Yang, Xiaohong Liu, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 VIKI-R通过强化学习协调多智能体合作,提出分层基准VIKI-Bench,显著提升多智能体视觉驱动合作性能。

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks. Project page: https://faceong.github.io/VIKI-R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05600 2026-01-12 cs.CV cs.CL cs.LG 79%

SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes

SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图

Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) University of New South Wales(新南威尔士大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 79%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08889 2025-12-10 cs.CV cs.AI 79%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 79%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22586 2025-12-01 cs.CV cs.AI 79%

Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization

重新审视基于视觉推理泛化性的长链式推理的必要性

Yifan Du, Kun Zhou, Yingqian Min, Yue Ling, Wayne Xin Zhao, Youbin Wu

机构 * Renmin University of China(中国人民大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了不同链式推理设计对视觉推理泛化能力的影响,发现简洁的链式推理在不同迷宫规模中表现最佳,提出'短即长'效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 79%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00844 2025-11-18 cs.CV cs.LG 79%

PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks

Abdelrahman Elskhawy, Mengze Li, Nassir Navab, Benjamin Busam

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21538 2025-11-14 cs.CV cs.AI 79%

Caption This, Reason That: VLMs Caught in the Middle

Zihan Weng, Lucas Gomez, Taylor Whittington Webb, Pouya Bashivan

机构 * Integrated Program in Neuroscience (IPN) McGill University(神经科学联合计划 麦吉尔大学) Mila, University of Montreal(蒙特利尔大学Mila) Microsoft Research USA(微软研究院美国总部) Department of Physiology McGill University(生理学系 麦吉尔大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Paper accepted by nips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15966 2025-10-27 cs.CV cs.AI cs.CL 79%

Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05258 2025-10-16 cs.CV cs.LG 79%

Spatio-Temporal LLM: Reasoning about Environments and Actions

Haozhen Zheng, Beitong Tian, Mingyuan Wu, Zhenggang Tang, Klara Nahrstedt, Alex Schwing

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Code and data are available at https://zoezheng126.github.io/STLLM-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23250 2025-10-08 cs.AI cs.CV 79%

Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned

Brandon Ong, Tej Deep Pala, Vernon Toh, William Chandra Tjhi, Soujanya Poria

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25757 2025-10-01 cs.AI cs.CL cs.CV cs.SC 79%

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Danial Kamali, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00711 2025-09-03 cs.CV cs.AI 79%

VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework

Chao Wang, Chunbai Zhang, Yongxiao Tian, Yang Zhou, Yan Peng

机构 * School of Future Technology, Shanghai University(未来技术学院,上海大学) School of Mechatronic Engineering and Automation, Shanghai University(机械电子工程与自动化学院,上海大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 14 pages,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12109 2025-08-19 cs.CV cs.AI 79%

Simple o3: Towards Interleaved Vision-Language Reasoning

Ye Wang, Qianglong Chen, Zejun Li, Siyuan Wang, Shijie Guo, Zhirui Zhang, Zhongyu Wei

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04280 2025-06-06 cs.CV cs.AI 79%

Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark

Ziming Cheng, Binrui Xu, Lisheng Gong, Zuhe Song, Tianshuo Zhou, Shiqi Zhong, Siyu Ren, Mingxiang Chen, Xiangchao Meng, Yuxin Zhang, Yanlin Li, Lei Ren, Wei Chen, Zhiyuan Huang, Mingjie Zhan, Xiaojie Wang, Fangxiang Feng

机构 * BUPT China(北京邮电大学) YSU China(云南大学) NUS Singapore(新加坡国立大学) Li Auto Inc. China(利汽车公司) SenseTime Research China(商汤研究)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00569 2025-04-15 cs.CV cs.LG 79%

Probing Visual Language Priors in VLMs

Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, Honglak Lee

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Project Page: https://vilp-team.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏