arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-30 至 2026-03-30 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 9 篇

2603.26323 2026-03-30 cs.CL cs.AI 81%

From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs

从人类认知到神经激活:探究LLMs中空间推理的计算原语

Jiyuan An, Liner Yang, Mengyan Wang, Luming Lu, Weihua An, Erhong Yang

机构 * School of Information Science, Beijing Language and Culture University(北京语言大学信息科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析LLMs内部空间表示机制,发现其空间推理能力有限且依赖上下文,揭示了空间推理的计算原语及跨语言机制退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26639 2026-03-30 cs.CV cs.AI 79%

Make Geometry Matter for Spatial Reasoning

让几何在空间推理中发挥作用

Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GeoSR框架,通过几何解封掩码和几何引导融合,提升视觉语言模型的空间推理能力,实验证明其在静态和动态场景中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26362 2026-03-30 cs.CV 78%

HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models

HandVQA: 评估视觉-语言模型中手部精细空间推理的诊断与改进

MD Khalequzzaman Chowdhury Sayem, Mubarrat Tajoar Chowdhury, Yihalem Yimolal Tiruneh, Muneeb A. Khan, Muhammad Salman Ali, Binod Bhattarai, Seungryul Baek

机构 * UNIST(蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere (Redev.AI Ltd), UK(Fogsphere (Redev.AI Ltd),英国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 HandVQA通过视觉问答评估VLM对手部解剖的精细空间理解,发现现有模型在手部关节空间关系推理上的系统性缺陷,并通过3D数据训练提升模型在手部姿态识别和手-物交互任务中的性能。

Comments Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26018 2026-03-30 cs.CV cs.RO 78%

GeoReFormer: Geometry-Aware Refinement for Lane Segment Detection and Topology Reasoning

GeoReFormer:基于几何的车道线段检测与拓扑推理 refinement

Danny Abraham, Nikhil Kamalkumar Advani, Arun Das, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Bosch North America(博世北美)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GeoReFormer 提出一种统一的查询架构,通过嵌入几何和拓扑诱导偏差,提升车道线段检测和拓扑推理的精度与一致性,实现在 OpenLane-V2 上 34.5% 的 mAP 成绩。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22687 2026-03-30 cs.CV 78%

GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展

Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(九天研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26322 2026-03-30 cs.RO 67%

DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion

DiffusionAnything: 端到端的上下文扩散学习用于统一导航和预抓取运动

Iana Zhura, Yara Mahmoud, Jeffrin Sam, Hung Khang Nguyen, Didar Seyidov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院数字工程中心智能空间机器人实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种端到端的上下文扩散学习方法,通过多尺度特征调制实现统一的导航与精细操控,仅需5分钟自监督数据即可实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 57%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25766 2026-03-30 cs.RO cs.AI 57%

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26541 2026-03-30 cs.CV 50%

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP:开放词汇实例语义映射

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Zurich(苏黎世大学) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。

详情

展开后加载摘要…

URL PDF HTML 收藏