arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-01 至 2026-07-01 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 19 篇

2602.20055 2026-07-01 cs.RO cs.AI cs.CV 版本更新 79%

CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation

CoReLIN: 基于约束推理的零样本终身交互式导航

Apoorva Vashisth, Manav Kulshrestha, Pranav Bakshi, Damon Conover, Guillaume Sartoretti, Aniket Bera

机构 * Purdue University(普渡大学) Indian Institute of Technology, Kharagpur(印度理工学院卡哈拉格普尔分校) DEVCOM Army Research Lab(DEVCOM陆军研究实验室) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CoReLIN框架,利用LLM和场景图推理,在终身交互式导航中通过移动物体开辟路径并完成任务,显著提升长期效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31814 2026-07-01 cs.CV 新提交 78%

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

基于几何先验的自回归模型生成车道拓扑推理

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31645 2026-07-01 cs.CV 新提交 78%

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning

RoboSpatial Challenge at CVPR 2026技术报告:选择性推理激活与参考框架消歧用于具身空间推理

Yuxiang Xie, Qi Lv, Jianming Xing, Zijian Hong, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Ruoyu Technology(若愚科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出RoboSpatialBrain,通过强制<think>前缀激活和参考框架重定向两种无训练推理机制,解决具身空间推理中的歧义问题,在RoboSpatial-Home上达到80.9%成功率,获得挑战赛第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 78%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交 78%

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31157 2026-07-01 cs.CV 新提交 78%

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

重新思考基础模型协作:通过代理任务推理增强专用模型

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31071 2026-07-01 cs.CV cs.RO 新提交 78%

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

层次化3D场景图构建与基于信念的语义导航规划

Bing Wu, Zuyao Chen, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 提出零样本语义导航框架,通过在线维护层次化3D场景图(HSG)实现多粒度语义拓扑,并基于信念规划进行有限视野推演,在长距离导航中显著提升成功率与路径效率。

Comments Camera-ready version accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30698 2026-07-01 cs.RO 新提交 78%

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24814 2026-07-01 cs.RO 新提交 78%

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

面向内部物流的上下文语义建图中的视觉-语言模型推理

Marvin Rüdt, Hao Pang, Constantin Enke, Zäzilia Seibold, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出结合SLAM、SAM、实例聚类和VLM多视角推理的上下文语义建图流程,零样本推断物体可移动性,实现语义分类98.93% mIoU和可移动性估计89.17% mAcc。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31919 2026-07-01 cs.RO cs.AI cs.CV 新提交 70%

MVP-Nav: Multi-layer Value Map Planner Navigator

MVP-Nav: 多层价值地图规划导航器

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31813 2026-07-01 cs.LG cs.AI 新提交 62%

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

保持几何的正交初始化用于RLVR中的低秩适应

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超级智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。

Comments 30 pages, accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交 62%

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30608 2026-07-01 cs.CV 版本更新 50%

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

UnfoldArt: 从文本或图像零样本恢复完整关节式3D物体

Mohamed el Amine Boudjoghra, Ivan Laptev, Angela Dai

机构 * Technical University of Munich(慕尼黑工业大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出首个辩论驱动代理方法,结合视觉语言模型和视频生成先验,从文本或图像零样本重建关节式3D物体的结构、运动与隐藏几何。

Comments Project page: https://aminebdj.github.io/unfoldart

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30678 2026-07-01 physics.chem-ph physics.bio-ph physics.ed-ph 新提交 50%

NanoVer: An open-source framework for interactive molecular dynamics in extended reality (iMD-XR) on commodity hardware

NanoVer: 一个用于在消费级硬件上进行扩展现实交互式分子动力学(iMD-XR)的开源框架

Mark D. Wonnacott, Luis Ernesto Toledo Castro, Harry J. Stroud, Ludovica Aisa, Mohamed Dhouioui, Rhoslyn Roebuck Williams, Denis Protopopov, Sila Sobrado, David R. Glowacki

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文介绍NanoVer,一个开源框架,允许多人共处同一虚拟空间,以原子级精度实时操控柔性3D分子结构的分子动力学模拟,支持消费级独立XR硬件,并实现多客户端通信与多种任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新 50%

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 50%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :verifier(abstract)

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23721 2026-07-01 cs.RO cs.CV 版本更新 50%

StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation

StemVLA:一种融合未来3D空间几何知识与4D历史表示的开源视觉-语言-动作模型

Jiasong Xiao, Yutao She, Kai Li, Yuyang Sha, Ziang Cheng

机构 * Ricoh Software Research Center(理光软件研究中心) YZH Engineering Technology (Beijing) Co., Ltd.(易智赫工程技术(北京)有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出StemVLA框架,通过显式建模未来3D空间结构和历史4D时空表示,提升机器人操作任务中的空间推理与长时决策能力,在LIBERO基准上平均准确率达92.0%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11270 2026-07-01 cs.CV 版本更新 50%

Φeat: Physically Grounded Material Feature Representation

Φeat: 物理基础的材料特征表示

Giuseppe Vecchio, Adrien Kaiser, Claudia Cuttano, Rouffet Romain, Rosalie Martin, Elena Garces, Tamy Boubekeur

机构 * Adobe Research, France(Adobe研究院(法国))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Φeat视觉骨干网络,通过对比同一材料在不同光照和几何下的观测,学习对材料身份敏感的表征,提升材料选择与分类等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏