arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-20 至 2026-03-20 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2603.19039 2026-03-20 cs.CV 82%

TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation

TerraScope:基于像素的视觉推理用于地球观测

Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir, Nicu Sebe, Paolo Rota

机构 * University of Trento(特伦托大学) BIFOLD and TU Berlin(BIFOLD和柏林技术大学) Technical University of Munich(慕尼黑技术大学) MBZUAI

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

AI总结 TerraScope通过模态灵活推理和多时序推理,提升地球观测中像素级空间推理能力,提出Terra-CoT数据集和TerraScope-Bench基准,验证其在像素级地理空间推理中的优越性。

Comments Accepted by CVPR20206 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 81%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18523 2026-03-20 cs.CV cs.AI 79%

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

计数电路:大视觉-语言模型中视觉推理的机制可解释性

Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

机构 * Rutgers University(罗格斯大学) UC Santa Barbara(加州大学圣巴巴拉分校) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了大视觉-语言模型在计数任务中的机制,提出两种新方法揭示计数电路结构,并通过干预策略提升模型计数精度和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19137 2026-03-20 cs.CV cs.RO 78%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 70%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18443 2026-03-20 cs.CV 67%

SR-Nav: Spatial Relationships Matter for Zero-shot Object Goal Navigation

SR-Nav:空间关系对于零样本物体目标导航至关重要

Leyuan Fang, Zan Mao, Zijing Wang, Yinlong Yan

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SR-Nav通过建模观察和经验的空间关系,提升感知与规划能力,在HM3D实验中实现最先进的成功率和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18855 2026-03-20 cs.IT cs.LG cs.SY eess.SP eess.SY math.IT 57%

BeamAgent: LLM-Aided MIMO Beamforming with Decoupled Intent Parsing and Alternating Optimization for Joint Site Selection and Precoding

BeamAgent:基于解耦意图解析和交替优化的LLM辅助MIMO波束成形

Xiucheng Wang, Yue Zhang, Nan Cheng

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出BeamAgent框架,通过解耦语义意图解析与数值优化,结合交替优化算法解决基站选址与预编码设计问题,实现高效波束成形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 57%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG 57%

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19193 2026-03-20 cs.CV 50%

Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting

重建至关重要:通过3D高斯点云学习几何对齐的鸟瞰图表示

Yiren Lu, Xin Ye, Burhaneddin Yaman, Jingru Luo, Zhexiao Xiong, Liu Ren, Yu Yin

机构 * Bosch Research North America \& Bosch Center for Artificial Intelligence (BCAI) Case Western Reserve University Washington University in St. Louis

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Splat2BEV框架,通过3D高斯点云生成几何对齐的鸟瞰图特征,提升自动驾驶中的感知性能。

Comments Project page at https://vulab-ai.github.io/Splat2BEV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 50%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 50%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏