arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-06 至 2026-03-06 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 7 篇

2510.16714 2026-03-06 cs.CV cs.AI 89%

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

SceneCOT: 在3D场景中引导链式推理

Xiongkun Linghu, Jiangyong Huang, Ziyu Zhu, Baoxiong Jia, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。

Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16688 2026-03-06 cs.CV cs.AI 79%

Pursuing Minimal Sufficiency in Spatial Reasoning

追求空间推理的最小充分性

Yejie Guo, Yunzhong Hou, Wufei Ma, Meng Tang, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) Johns Hopkins University(约翰霍普金斯大学) University of California Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 MSSR 框架,通过构建最小充分集提升视觉-语言模型的空间推理能力,实现充分性与最小性的平衡,取得最佳性能并生成可解释的推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04614 2026-03-06 cs.CV 78%

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

SGR3模型:三维场景图检索-推理模型

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Shenzhen University(深圳大学) Hunan University(湖南大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 73%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04917 2026-03-06 cs.HC 50%

Roomify: Spatially-Grounded Style Transformation for Immersive Virtual Environments

Roomify:基于空间的风格转换用于沉浸式虚拟环境

Xueyang Wang, Qinxuan Cen, Weitao Bi, Yunxiang Ma, Xin Yi, Robert Xiao, Xinyi Fu, Hewu Li

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Roomify通过结合3D场景理解、AI推理和风格生成,实现基于用户实际空间的沉浸式虚拟环境转换,提升沉浸感和创意表达性。

Comments Accepted at CHI 2026 (ACM Conference on Human Factors in Computing Systems). 24 pages, 10 figures. Author's version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04695 2026-03-06 cs.RO 50%

Selecting Spots by Explicitly Predicting Intention from Motion History Improves Performance in Autonomous Parking

通过显式预测意图来选择斑点提高了自动驾驶停车的性能

Long Kiu Chung, David Isele, Faizan M. Tariq, Sangjae Bae, Shreyas Kousik, Jovin D'sa

机构 * Honda Research Institute (HRI)(本田研究机构) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种通过显式预测意图来选择停车位的自动驾驶停车方法,提高了停车任务的预测准确性、社会接受度和任务完成度。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22091 2026-03-06 cs.CV 50%

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练

Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan

机构 * Applied Intuition Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏