arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-28 至 2026-07-28 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2607.24199 2026-07-28 cs.CV 新提交 90%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);verifier(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22732 2026-07-28 cs.AI 新提交 88%

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

大语言模型游戏智能体中的空间推理:因果上下文和多步规划的影响

Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 研究基于大语言模型的游戏智能体在复杂任务中表现不佳的问题,通过实验验证因果提示增强和多步规划可提升胜率并控制延迟,引入新基准评估,发现较大模型定位更准,融入因果上下文和多步规划能优化性能与速度。

Comments To be published at COG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25629 2026-07-28 cs.CV cs.LG 版本更新 79%

LanteRn: Latent Visual Structured Reasoning

LanteRn:潜在视觉结构推理

André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

机构 * Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05387 2026-07-28 cs.CV cs.LG 版本更新 79%

Parallel Swin Transformer-Enhanced 3D MRI-to-CT Synthesis for MRI-Only Radiotherapy Planning

并行Swin Transformer增强的3D MRI到CT合成用于仅MRI放疗规划

Zolnamar Dorjsembe, Hung-Yi Chen, Furen Xiao, Hsing-Kuo Pao

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出并行Swin Transformer增强的Med2Transformer架构,通过结合卷积编码与双Swin Transformer分支,提高MRI到CT合成的图像质量和几何精度,实现仅MRI的放疗规划。

Comments This preprint has been accepted for publication in the proceedings of the IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026). The final published version is available at https://doi.org/10.1109/ISBI61048.2026.11515734. The copyright for this work has been transferred to IEEE

Journal ref Proceedings of the 23rd IEEE International Symposium on Biomedical Imaging (ISBI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 77%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24586 2026-07-28 cs.CL cs.AI 新提交 62%

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D分数:一种用于大语言模型中幻觉检测的谱隐藏状态信号

Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

机构 * Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型幻觉检测,提出基于隐藏激活几何结构的D分数,通过单次前向传播计算,用作幻觉分数。经实验验证,该分数是强大的隐藏状态信号,检测时无需外部验证器等,为幻觉检测提供新方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 57%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-07-28 cs.CV cs.CL 新提交 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 57%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15476 2026-07-28 cs.RO 版本更新 50%

FARM: Find Anything using Relational Spatial Memory

FARM: 使用关系空间记忆找到任何物体

Siming He, Leo Huang, Adam Lilja, Fabio Huebel, Jonas Frey, Marco Pavone, S. Shankar Sastry, Jitendra Malik, Claire Tomlin

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出FARM系统,通过实时构建包含几何、视觉语言描述和视角证据的开放词汇物体级记忆,并利用VLM解析查询和显式空间约束,在44k语言查询中Recall@5和Recall@10分别提升164%和224%,Accuracy@1提升35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03316 2026-07-28 cs.CV 版本更新 50%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 50%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 视觉空间推理 :CoT(abstract)

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 50%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏