arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-20 至 2026-03-20 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2603.19170 2026-03-20 cs.RO math.OC 50%

ADMM-Based Distributed MPC with Control Barrier Functions for Safe Multi-Robot Quadrupedal Locomotion

基于ADMM的分布式MPC与控制屏障函数用于安全多机器人四足运动

Yicheng Zeng, Ruturaj S. Sambhus, Basit Muhammad Imran, Jeeseop Kim, Vittorio Pastore, Kaveh Akbari Hamed

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) The University of Texas at El Paso(德克萨斯理工大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于ADMM的去中心化MPC框架,结合控制屏障函数约束,用于多机器人腿部系统的安全轨迹规划。通过节点-边分割公式与共识约束,将全局问题分解为独立二次规划问题,实现高效去中心化优化,提升实时性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10965 2026-03-20 cs.CE 50%

Geospatial AI for Liquefaction Hazard and Impact Forecasting: A Demonstrative Study in the U.S. Pacific Northwest

地理空间AI用于液化危险和影响预测:美国太平洋西北地区示范研究

Morgan D. Sanger, Brett W. Maurer

专题命中 规划推理 :planning(abstract)

AI总结 本文利用地理空间AI模型预测美国华盛顿和俄勒冈州85个地震场景的液化危险,结合机器学习提升预测精度,并通过资产和基础设施脆弱性评估验证其应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11052 2026-03-20 cs.RO 50%

AdaptPNP: Integrating Prehensile and Non-Prehensile Skills for Adaptive Robotic Manipulation

AdaptPNP: 集成抓取与非抓取技能以实现适应性机器人操控

Jinxuan Zhu, Chenrui Tie, Xinyi Cao, Yuran Wang, Jingxiang Guo, Zixuan Chen, Haonan Chen, Junting Chen, Yangyu Xiao, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) RoboScience(机器人科学) East China Normal University(华东师范大学) Peking University(北京大学) Nanjing University(南京大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出AdaptPNP框架,通过视觉-语言模型整合抓取与非抓取技能,实现复杂机器人操控任务的规划与执行。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 12 篇

2603.19039 2026-03-20 cs.CV 82%

TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation

TerraScope:基于像素的视觉推理用于地球观测

Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir, Nicu Sebe, Paolo Rota

机构 * University of Trento(特伦托大学) BIFOLD and TU Berlin(BIFOLD和柏林技术大学) Technical University of Munich(慕尼黑技术大学) MBZUAI

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

AI总结 TerraScope通过模态灵活推理和多时序推理,提升地球观测中像素级空间推理能力,提出Terra-CoT数据集和TerraScope-Bench基准,验证其在像素级地理空间推理中的优越性。

Comments Accepted by CVPR20206 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 81%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18523 2026-03-20 cs.CV cs.AI 79%

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

计数电路:大视觉-语言模型中视觉推理的机制可解释性

Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

机构 * Rutgers University(罗格斯大学) UC Santa Barbara(加州大学圣巴巴拉分校) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了大视觉-语言模型在计数任务中的机制,提出两种新方法揭示计数电路结构,并通过干预策略提升模型计数精度和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19137 2026-03-20 cs.CV cs.RO 78%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18795 2026-03-20 cs.CV cs.AI 70%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18443 2026-03-20 cs.CV 67%

SR-Nav: Spatial Relationships Matter for Zero-shot Object Goal Navigation

SR-Nav:空间关系对于零样本物体目标导航至关重要

Leyuan Fang, Zan Mao, Zijing Wang, Yinlong Yan

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SR-Nav通过建模观察和经验的空间关系,提升感知与规划能力,在HM3D实验中实现最先进的成功率和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18855 2026-03-20 cs.IT cs.LG cs.SY eess.SP eess.SY math.IT 57%

BeamAgent: LLM-Aided MIMO Beamforming with Decoupled Intent Parsing and Alternating Optimization for Joint Site Selection and Precoding

BeamAgent:基于解耦意图解析和交替优化的LLM辅助MIMO波束成形

Xiucheng Wang, Yue Zhang, Nan Cheng

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出BeamAgent框架,通过解耦语义意图解析与数值优化,结合交替优化算法解决基站选址与预编码设计问题,实现高效波束成形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 57%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG 57%

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19193 2026-03-20 cs.CV 50%

Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting

重建至关重要:通过3D高斯点云学习几何对齐的鸟瞰图表示

Yiren Lu, Xin Ye, Burhaneddin Yaman, Jingru Luo, Zhexiao Xiong, Liu Ren, Yu Yin

机构 * Bosch Research North America \& Bosch Center for Artificial Intelligence (BCAI) Case Western Reserve University Washington University in St. Louis

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Splat2BEV框架,通过3D高斯点云生成几何对齐的鸟瞰图特征,提升自动驾驶中的感知性能。

Comments Project page at https://vulab-ai.github.io/Splat2BEV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 50%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 50%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2603.19118 2026-03-20 cs.AI cs.CL cs.LG 85%

How Uncertainty Estimation Scales with Sampling in Reasoning Models

推理模型中不确定性估计随采样规模的变化

Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

机构 * Institute of Computer Science(计算机科学研究所) University of Tartu(塔尔图大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型中不确定性估计随采样规模变化的机制,通过平行采样方法分析自一致性与置信度信号的扩展链式推理表现,发现信号组合能显著提升AUROC性能,且领域依赖性明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18620 2026-03-20 cs.CL cs.AI 62%

Learning to Self-Evolve

学习自我进化

Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Mila – Quebec AI Institute(魁北克AI研究院) University of Montreal(蒙特利尔大学) Snowflake(Snowflake公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSE框架,通过强化学习训练大语言模型在测试时自我改进上下文,实验显示其在文本到SQL生成和通用问答任务中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG 62%

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18850 2026-03-20 cs.CV 50%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 6 篇

2603.17024 2026-03-20 cs.CV cs.AI cs.CL 86%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16252 2026-03-20 cs.CL 85%

Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning

Fin-R1:通过强化学习构建的金融推理大语言模型

Zhaowei Liu, Xin Guo, Zhi Yang, Fangqi Lou, Lingfeng Zeng, Jinyi Niu, Mengping Li, Qi Qi, Zhiqiang Liu, Yiyang Han, Dongpo Cheng, Ronghao Chen, Huacan Wang, Xingdong Feng, Huixia Judy Wang, Chengchun Shi, Liwen Zhang

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics, China(上海金融学院统计与数据科学学院,中国) School of Mathematical Sciences, Fudan University, China(复旦大学数学科学学院,中国) School of Economics, Shanghai University of Finance and Economics, China(上海金融学院经济学院,中国) AI Finance Development and Service Center, Shanghai University of Finance and Economics, China(上海金融学院人工智能金融发展与服务中心,中国) QuantaAlpha, China(QuantaAlpha,中国) Department of Statistics, Rice University, USA(里士满大学统计学系,美国) Department of Statistics, London School of Economics and Political Science, UK(伦敦政治经济学院统计学系,英国) Qinghai Provincial Key Laboratory of Big Data in Finance and Artificial Intelligence Application Technology, Qinghai Institute of Technology, China(青海省大数据在金融与人工智能应用技术重点实验室,青海技术学院,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Fin-R1通过强化学习方法,解决金融领域推理问题,具备高精度和可解释性,适用于合规检查和智能投顾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01113 2026-03-20 cs.CL 85%

LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics

LLMs忠实且迭代地计算答案期间进行Co-T:多步算术中的系统分析

Keito Kudo, Yoichi Aoki, Tatsuki Kuribayashi, Shusaku Sone, Masaya Taniguchi, Ana Brassard, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) MBZUAI

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究LLMs在Co-T推理中的内部信息流,发现其在生成推理链时逐步计算子答案,而非预先确定最终答案,从而验证了推理链的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-03-20 cs.AI cs.LG 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03415 2026-03-20 cs.CL cs.AI 62%

Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs

越远离分布,表示越稀疏:分析LLM中的OOD机制

Mingyu Jin, Yutong Yin, Jingcheng Niu, Qingcheng Zeng, Wujiang Xu, Mengnan Du, Wei Cheng, Zhaoran Wang, Tianlong Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) UKP Lab, TU Darmstadt(德累斯顿技术大学UKP实验室) New Jersey Institute of Technology(新泽西理工学院) NEC Lab American(美国NEC实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在面对难度增加的输入时内部表示的适应机制,发现任务难度提升导致最后隐藏层表示稀疏化,提出基于稀疏性的课程学习策略提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18273 2026-03-20 cs.AI 57%

EDM-ARS: A Domain-Specific Multi-Agent System for Automated Educational Data Mining Research

EDM-ARS:一种面向领域的多智能体系统用于自动化教育数据挖掘研究

Chenguang Pan, Zhou Zhang, Weixuan Xiao, Chengyuan Yao

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 EDM-ARS通过多智能体系统实现教育数据挖掘的自动化研究,包含五个LLM驱动的智能体,生成包含实证分析和同行评审的LaTeX论文。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 26 篇

2510.11173 2026-03-20 cs.CV cs.MM 89%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 83%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 81%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19017 2026-03-20 cs.CL cs.AI 81%

What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?

真正控制大语言模型时间推理的是令牌化还是时间表示?

Gagan Bhatia, Ahmad Muhammad Isa, Maxime Peyrard, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) Université Grenoble Alpes & CNRS(格勒诺布尔阿尔卑斯大学及国家科学研究中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过MultiTempBench验证了大语言模型时间推理的核心因素,发现令牌化质量是资源依赖型瓶颈,同时时间线性度在高资源语言中是主要预测因素,而碎片化在低资源语言中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21814 2026-03-20 cs.AI cs.CL 81%

Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem

提示架构决定推理质量:关于汽车洗问题的变量隔离研究

Heejin Jo

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过变量隔离研究,探讨了提示架构层在汽车洗问题推理中的作用,发现STAR框架可将准确率提升至85%,结合用户资料和RAG上下文后达到100%。

Comments 9 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏