arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2504.09000 2025-04-15 cs.RO 85%

CL-CoTNav: Closed-Loop Hierarchical Chain-of-Thought for Zero-Shot Object-Goal Navigation with Vision-Language Models

Yuxin Cai, Xiangkun He, Maonan Wang, Hongliang Guo, Wei-Yun Yau, Chen Lv

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18141 2025-03-25 cs.CV 85%

AGIR: Assessing 3D Gait Impairment with Reasoning based on LLMs

Diwei Wang, Cédric Bobenrieth, Hyewon Seo

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26742 2026-03-31 cs.CL cs.LG 84%

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计

Swastik R

机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。

Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00054 2025-11-04 cs.LG cs.AI 84%

SpatialTraceGen: High-Fidelity Traces for Efficient VLM Spatial Reasoning Distillation

Gio Huh, Dhruv Sheth, Rayhan Zirvi, Frank Xiao

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12275 2024-11-13 cs.RO cs.AI cs.CV cs.LG cs.MA 84%

Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation

Jiachen Li, Chuanbo Hua, Jianpeng Yao, Hengbo Ma, Jinkyoo Park, Victoria Dax, Mykel J. Kochenderfer

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

Comments Project website: https://relational-reasoning-nav.github.io/; 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19824 2026-08-13 cs.AI cs.CL cs.CV cs.RO 84%

From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning

从提示到路面通过时间:代理场景到计划推理中的时间定位

Ahmed Y. Gado, Omar Y. Goba, Alaa Hassanein, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18212 2026-06-23 cs.LG cs.AI cs.RO cs.SY eess.SY 84%

SCoTT: Strategic Chain-of-Thought Tasking for Wireless-Aware Robot Navigation in Digital Twins

SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划

Aladin Djuhera, Amin Seffo, Vlad C. Andrei, Holger Boche, Walid Saad

机构 * Technical University of Munich(慕尼黑技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。

Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11995 2026-06-10 cs.CV cs.AI cs.LG 版本更新 84%

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

V-REX: 通过问题链进行探索性视觉推理的基准测试

Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院市分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15454 2026-06-05 cs.CL cs.LG stat.ML 84%

Reasoning Models Don't Just Think Longer, They Move Differently

推理模型不只思考更久,它们的移动方式不同

Anders Gjølbye, Lars Kai Hansen, Sanmi Koyejo

机构 * Technical University of Denmark(丹麦技术大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了推理训练模型在生成链式思维时的轨迹差异,发现通过长度校正后,不同领域中难度与轨迹几何的耦合关系存在显著差异,尤其是在代码领域中,推理训练模型表现出更直接的轨迹和更一致的局部曲率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08236 2026-06-02 cs.CV cs.AI cs.CL 84%

When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning

何时想象以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理

Shoubin Yu, Yue Zhang, Zun Wang, Jaehong Yoon, Huaxiu Yao, Mingyu Ding, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自适应测试时框架AVIC/AVIC-R,通过世界模型选择性调用和缩放视觉想象,在空间推理中平衡准确性与效率,超越GPT-4o等基线。

Comments the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17629 2026-05-26 cs.CV cs.AI cs.CL 84%

CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning

CLiViS: 通过语言-视觉协同释放认知地图用于具身视觉推理

Kailing Li, Qi'ao Xu, Tianwen Qian, Yuqian Fu, Yang Jiao, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) King Abdullah University of Science and Technology(科廷大学) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出CLiViS框架,通过LLM进行高层任务规划并协调VLM驱动的开放世界视觉感知,构建动态认知地图以迭代更新场景上下文,实现无需训练的具身视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 84%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20784 2026-05-21 cs.AI cs.LG 84%

Interaction Locality in Hierarchical Recursive Reasoning

层次递归推理中的交互局部性

Yosuke Miyanishi, Tetsuro Morimura

机构 * CyberAgent Inc.(CyberAgent公司)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出交互局部性框架,用于测量信息流是否在附近单元或语义段内传输或跨越,通过在HRM和TRM等层次递归推理模型上应用,验证了局部执行与全局规划的可重复测量框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14358 2026-05-15 cs.AI cs.LG 84%

Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces

揭示过度完备推理轨迹中最小核心的表示几何

Sanjoy Chowdhury, Dinesh Manocha

机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了过度完备推理轨迹中最小核心的表示几何,通过定义最小核心并提出压缩比、冗余质量等指标,发现平均46%的步骤可被移除且保留原答案,同时最小核心提升了正确-错误轨迹分离度,降低了内在维度,且在不同模型间具有高转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 84%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07516 2026-05-08 cs.AI cs.CL 84%

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM: 一种面向流行路径查询的多智能体方法

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of Utah(犹他大学) Monash University(莫纳什大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13358 2026-04-01 cs.AI cs.LG 84%

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

思维的几何学:大规模语言模型中规模如何重构推理

Samuel Cyrenius Anderson

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大规模语言模型中推理能力的几何重构特性,通过分析不同领域和规模的推理轨迹,发现神经规模定律触发领域特定的相变而非均匀能力提升,提出神经推理算子并识别出跨领域和规模的振荡特征。

Comments The theoretical framework has been shown to be wrong and should not be followed for future research direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23328 2026-01-05 cs.AI cs.CL cs.CV 84%

CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations

CubeBench: 在部分观察下诊断交互式、长周期空间推理

Huan-ang Gao, Zikang Zhang, Tianwei Luo, Kaisen Yang, Xinzhe Juan, Jiahao Qiu, Tianxing Chen, Bingxiang He, Hao Zhao, Hao Zhou, Shilong Liu, Mengdi Wang

机构 * THU(清华大学) Princeton(普林斯顿大学) SJTU & UMich(上海交通大学 & 密歇根大学) HKU(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CubeBench通过魔方基准评估LLM在部分观察下的空间推理和长周期任务能力,揭示LLM在长期规划中的根本缺陷。

Comments Webpage: https://cubebench.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22146 2025-11-11 cs.CV cs.AI cs.LG 84%

Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs

Amirmohammad Izadi, Mohammad Ali Banayeeanzade, Fatemeh Askari, Ali Rahimiakbar, Mohammad Mahdi Vahedi, Hosein Hasani, Mahdieh Soleymani Baghshah

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15966 2025-10-27 cs.CV cs.AI cs.CL 84%

Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Vector Institute(向量研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12198 2025-08-19 physics.ao-ph cs.AI cs.LG 84%

Exploring Multimodal AI Reasoning for Meteorological Forecasting from Skew-T Diagrams

ChangJae Lee, Heecheol Yang, Jonghak Choi

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03450 2025-08-12 cs.LG cs.AI cs.MA cs.RO 84%

Schema-Guided Scene-Graph Reasoning based on Multi-Agent Large Language Model System

Yiye Chen, Harpreet Sawhney, Nicholas Gydé, Yanan Jian, Jack Saunders, Patricio Vela, Ben Lundell

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02669 2025-06-03 cs.CV cs.CL cs.LG 84%

Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?

Simon Park, Abhishek Panigrahi, Yun Cheng, Dingli Yu, Anirudh Goyal, Sanjeev Arora

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14379 2025-05-13 cs.AI cs.LG 84%

The Geometry of Self-Verification in a Task-Specific Reasoning Model

Andrew Lee, Lihao Sun, Chris Wendler, Fernanda Viégas, Martin Wattenberg

机构 * Harvard University(哈佛大学) University of Chicago(芝加哥大学) Northeastern University(东北大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07376 2025-03-25 cs.CV cs.AI cs.CL cs.RO 84%

NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning

Bingqian Lin, Yunshuang Nie, Ziming Wei, Jiaqi Chen, Shikui Ma, Jianhua Han, Hang Xu, Xiaojun Chang, Xiaodan Liang

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted by TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02172 2025-03-19 cs.CV cs.AI cs.CL 84%

VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning

Xueqing Wu, Yuheng Ding, Bingxuan Li, Pan Lu, Da Yin, Kai-Wei Chang, Nanyun Peng

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments CVPR 2025. https://visco-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01892 2025-01-20 cs.AI cs.CL 84%

GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning

Zhisheng Tang, Mayank Kejriwal

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11974 2024-12-18 cs.RO cs.AI cs.CL cs.CV 84%

Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning

Qi Sun, Pengfei Hong, Tej Deep Pala, Vernon Toh, U-Xuan Tan, Deepanway Ghosal, Soujanya Poria

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03548 2024-12-10 cs.CV cs.AI cs.LG 84%

Perception Tokens Enhance Visual Reasoning in Multimodal Language Models

Mahtab Bigverdi, Zelun Luo, Cheng-Yu Hsieh, Ethan Shen, Dongping Chen, Linda G. Shapiro, Ranjay Krishna

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04732 2024-10-02 cs.AI cs.CL cs.CV 84%

How Far Are We from Intelligent Visual Deductive Reasoning?

Yizhe Zhang, He Bai, Ruixiang Zhang, Jiatao Gu, Shuangfei Zhai, Josh Susskind, Navdeep Jaitly

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments COLM 2024. https://github.com/apple/ml-rpm-bench

详情

展开后加载摘要…

URL PDF HTML 收藏