arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 9 篇

2603.25091 2026-03-27 cs.CV cs.AI 83%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24721 2026-03-27 cs.CV cs.AI cs.LG cs.MM 81%

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

可扩展的对象关系编码以提升大语言模型中的3D空间推理

Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuatRoPE,通过线性增长的对象数量输入长度和注意力层中的点积计算配对空间关系,提升大语言模型在3D空间推理中的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06663 2026-03-27 cs.CV cs.AI 79%

Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting

图标记:通过基于图的视觉提示提升多模态语言模型的空间推理能力

Giacomo Frisoni, Lorenzo Molfetta, Mattia Buzzoni, Gianluca Moro

机构 * University of Bologna(博洛尼亚大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Graph-of-Mark,一种基于图的视觉提示方法,通过在输入图像上叠加场景图来增强多模态语言模型的空间推理能力,实验表明其在视觉问答和定位任务中提升了11个百分点的准确率。

Comments Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13133 2026-03-27 cs.RO 71%

DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation

DecoVLN:解耦观察、推理与修正以实现视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Bin Wang, Runmin Cong, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 DecoVLN通过优化长期记忆构建和修正策略,提升长周期导航的鲁棒性与稳定性,实验证明其在真实环境中的有效性。

Comments 16 pages, 8 figures, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 67%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19354 2026-03-27 cs.CL cs.AI 66%

GeoResponder: Towards Building Geospatial LLMs for Time-Critical Disaster Response

GeoResponder:迈向构建用于时间敏感灾害响应的地理空间大语言模型

Ahmed El Fekih Zguir, Ferda Ofli, Muhammad Imran

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 GeoResponder通过分层指令微调课程,赋予大语言模型空间推理能力,通过在不同认知层中分层地理空间学习,使模型能够有效处理灾害响应中的道路网络、坐标和基础设施访问问题,显著优于现有基础模型和领域特定基线。

Comments 16 pages, 5 figures, Major revision with new geospatial reasoning framework (GeoResponder), previously titled "RoadMind"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24908 2026-03-27 cs.RO cs.AI cs.MA 57%

Integrated Multi-Drone Task Allocation, Sequencing, and Optimal Trajectory Generation in Obstacle-Rich 3D Environments

集成多无人机任务分配、任务序列和最优轨迹生成在障碍密集的3D环境中

Yunes Alqudsi, Murat Makaraci

机构 * Aerospace Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院航空航天工程系) Interdisciplinary Research Center for Aviation and Space Exploration, KFUPM(法赫德国王石油矿产大学航空与空间探索跨学科研究中心) Mechanical Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院机械工程系)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出IMD-TAPP框架,通过结合离散任务规划和连续轨迹合成,解决多无人机在障碍密集环境中的任务分配、序列规划和安全轨迹生成问题,实现动态可行且无碰撞的高效路径。

Comments Resubmission following accepted appeal (MOD-78958). Resubmitting to cs.RO with cross-lists cs.MA and cs.AI as advised by arXiv Support

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV 50%

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25004 2026-03-27 cs.CV cs.MM 50%

Interpretable Zero-shot Referring Expression Comprehension with Query-driven Scene Graphs

可解释的零样本指代表达理解与查询驱动的场景图

Yike Wu, Necva Bolucu, Stephen Wan, Dadong Wang, Jiahao Xia, Jian Zhang

机构 * Faculty of Engineering and IT, University of Technology Sydney(悉尼科技大学工程与信息技术学院) Data61, Commonwealth Scientific and Industrial Research Organisation(澳大利亚联邦科学与工业研究组织 Data61)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SGREC方法,通过查询驱动的场景图作为结构化中介,结合视觉语言模型和大语言模型,实现可解释的零样本指代表达理解,在多个基准测试中取得优异成绩。

Comments Accepted by T-MM

详情

展开后加载摘要…

URL PDF HTML 收藏