arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG 82%

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19661 2026-03-03 cs.CV 82%

CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

CodeV: 通过工具感知策略优化实现基于图像的代码推理

Xinhai Hou, Shaoyuan Xu, Manan Biyani, Moyan Li, Jia Liu, Todd C. Hollon, Bryan Wang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 CodeV通过工具感知策略优化提升视觉推理的忠实度,实现更高准确率和更可靠的工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV 82%

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09972 2026-02-11 cs.RO 82%

Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning

Hydra-Nav: 通过自适应双过程推理实现物体导航

Zixuan Wang, Huang Fang, Shaoan Wang, Yuanfei Luo, Heng Dong, Wei Li, Yiming Gan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11397 2026-02-10 cs.CV 82%

EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning

通过LLM赋能的视觉指令微调提升几何推理能力

Zhihao Li, Yao Du, Yang Liu, Yan Zhang, Yufang Liu, Mengdi Zhang, Xunliang Cai, Charles Ling, Boyu Wang

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Meituan Inc.(美团公司) Department of Automation, Tsinghua University(自动化系,清华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 EAGLE通过视觉增强框架提升几何推理能力,解决MLLMs在几何理解与视觉感知上的不足。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06166 2026-02-09 cs.CV 82%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 82%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV 82%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18190 2025-12-29 cs.AI cs.CL cs.LG 82%

External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning

外部海马体:用于引导大语言模型推理的拓扑认知图

Jian Yan

机构 * School of Computer Science, Zunyi Normal University(计算机科学学院,遵义师范学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出External Hippocampus框架,通过拓扑认知图引导大语言模型推理,解决多步推理中的认知死锁问题,提升推理效率和准确性。

Comments 12 pages, 7 figures. v3: replaces v2 (uploaded in error); updated to two-column format; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07276 2025-12-23 cs.CV 82%

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07148 2025-12-17 cs.CV cs.AI cs.CL cs.LG 82%

MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models

MM-PoE:通过多模态模型的排除过程进行多选推理

Sayak Chakrabarty, Souradip Pal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12718 2025-11-27 cs.CV 82%

EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer

EvoEmpirBench: 基于智能体经验的动态空间推理

Pukun Zhao, Longxiang Wang, Miaowei Wang, Chen Chen, Fanqing Zhou, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东金融学院) Chongqing University(重庆大学) University of Edinburgh(爱丁堡大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 EvoEmpirBench通过动态空间基准评估模型在部分可观测和动态环境下的空间推理与记忆能力,揭示主流模型的限制并提供未来研究平台。

Comments Accepted by AAAI 2026, 29 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13733 2025-11-26 cs.RO 82%

FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph

基于分层多模态场景图的视觉语言导航:快速与慢速推理

Xiaolin Zhou, Tingyang Xiao, Liu Liu, Yucheng Wang, Maiyue Chen, Xinrui Meng, Xinjie Wang, Wei Feng, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 FSR-VLN通过分层多模态场景图与快速-慢速推理机制,提升视觉语言导航的效率与准确性,实现低延迟高成功率的导航性能。

Comments Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24473 2025-11-20 cs.CV cs.AI cs.CL cs.LG 82%

Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks

Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) East China Normal University(华东师范大学) Zhengzhou University(郑州大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05894 2025-11-11 cs.CV 82%

Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning

Fei Yu, Quan Deng, Shengeng Tang, Yuehua Li, Lechao Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04220 2025-11-06 cs.CV 82%

Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs

Fangrui Zhu, Hanhui Wang, Yiming Xie, Jing Gu, Tianye Ding, Jianwei Yang, Huaizu Jiang

机构 * Northeastern University(东北大学) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments NeurIPS 2025, code link: https://github.com/neu-vi/struct2d

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13055 2025-11-03 cs.CV 82%

NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation

Xiangyan Liu, Jinjie Ni, Zijian Wu, Chao Du, Longxu Dou, Haonan Wang, Tianyu Pang, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);test-time compute(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12448 2025-10-27 cs.CV 82%

SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning

Yang Liu, Ming Ma, Xiaomin Yu, Pengxiang Ding, Han Zhao, Mingyang Sun, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13800 2025-10-17 cs.CV 82%

Reasoning in Space via Grounding in the World

Yiming Chen, Zekun Qi, Wenyao Zhang, Xin Jin, Li Zhang, Peidong Liu

机构 * Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(技术研究院) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06856 2025-09-30 cs.CV 82%

Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning

Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

机构 * Sangfor Technologies The Australian National University(澳大利亚国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06729 2025-09-17 cs.RO 82%

STRIVE: Structured Representation Integrating VLM Reasoning for Efficient Object Navigation

Haokun Zhu, Zongtai Li, Zhixuan Liu, Wenshan Wang, Ji Zhang, Jonathan Francis, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for AI(博世人工智能中心)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments We remove OSG and CogNav from Table. 1 for a fair comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10884 2025-09-16 cs.RO cs.CV 82%

Nav-R1: Reasoning and Navigation in Embodied Scenes

Qingxiang Liu, Ting Huang, Zeyu Zhang, Hao Tang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16654 2025-09-11 cs.CV 82%

MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning

Chenghao Liu, Zhimu Zhou, Jiachen Zhang, Minghao Zhang, Songfang Huang, Huiling Duan

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18292 2025-08-27 cs.RO 82%

Enhancing Multi-Robot Semantic Navigation Through Multimodal Chain-of-Thought Score Collaboration

Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li

机构 * Zhixuan Shen, Haonan Luo, Kexun Chen, Fengmao Lv, Tianrui Li(作者)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);planning(abstract)

Comments 16 pages, 10 figures, Extended Version of accepted AAAI 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16972 2025-08-26 cs.CV 82%

Robust Diagram Reasoning: A Framework for Enhancing LVLM Performance on Visually Perturbed Scientific Diagrams

Minghao Zhou, Rafael Souza, Yaqian Hu, Luming Che

机构 * Taiyuan University of Science and Technology(太原科技大学) University of Brasilia(巴西利亚大学)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23478 2025-08-01 cs.CV 82%

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding

Ting Huang, Zeyu Zhang, Hao Tang

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11001 2025-07-16 cs.RO cs.CV 82%

Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation

Yanbo Wang, Zipeng Fang, Lei Zhao, Weidong Chen

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08306 2025-07-14 cs.AI cs.CL cs.CV cs.LG 82%

M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning

Inclusion AI, :, Fudong Wang, Jiajia Liu, Jingdong Chen, Jun Zhou, Kaixiang Ji, Lixiang Ru, Qingpei Guo, Ruobing Zheng, Tianqi Li, Yi Yuan, Yifan Mao, Yuting Xiao, Ziping Ma

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07781 2025-07-11 cs.CV cs.RO 82%

SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes

Jiaxin Huang, Ziwen Li, Hanlve Zhang, Runnan Chen, Xiao He, Yandong Guo, Wenping Wang, Tongliang Liu, Mingming Gong

机构 * MBZUAI The University of Sydney(悉尼大学) AI2Robotic Texas A&M University(德克萨斯大学) The University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07297 2025-07-11 cs.CV 82%

MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning

Chengfei Wu, Ronald Seoh, Bingxuan Li, Liqiang Zhang, Fengrong Han, Dan Goldwasser

机构 * Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校) University of Connecticut(康涅狄格大学) University of California Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏