arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 179 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2508.14828 2026-03-24 cs.CL cs.AI cs.LG 89%

Long Chain-of-Thought Reasoning Across Languages

跨语言的长链式推理

Josh Barua, Seun Eisape, Kayo Yin, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了跨语言长链式推理能力的扩展机制,发现模型规模扩展提升En-CoT性能,但Target-CoT表现滞后,尤其在数学推理中更为明显。通过预训练和后训练优化,多语言模型在推理效率和稳定性上取得进展,同时揭示了语言特定的失败模式。

Comments Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27419 2026-03-24 cs.AI cs.CL 86%

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

DeepCompress:一种双奖励策略用于动态探索和压缩推理链

Tian Liang, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13170 2026-03-24 cs.CL 85%

Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism

戴上思考帽子:从人类推理机制视角对链式思考微调的综述

Xiaoshu Chen, Sihang Zhou, Ke Liang, Duanyang Yuan, Haoyuan Chen, Xiaoyu Sun, Lingyuan Meng, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL

AI总结 本文从人类推理机制角度综述了链式思考微调,分析其通过六顶思考帽子框架分类方法,并探讨未来研究方向及现有数据集与模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01037 2026-03-24 cs.LG cs.AI 84%

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

CurES:从梯度分析到高效课程学习以提升推理大语言模型

Yongcheng Zeng, Zexu Sun, Bokai Ji, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Haifeng Zhang, Xu Chen, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baidu Inc.(百度公司) University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CurES方法,通过梯度优化理论分析,改进大语言模型推理任务的训练效率,实验显示其在多个数学推理基准上优于现有方法。

Comments 25 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG 79%

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22206 2026-03-24 cs.LG 70%

Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs

Chimera:面向异构大语言模型的延迟与性能感知多智能体服务

Kangqi Ni, Wenyue Hua, Xiaoxiang Shi, Jiang Guo, Shiyu Chang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 Chimera通过语义路由和预测调度优化多智能体工作流服务,提升端到端延迟与任务性能,减少1.2-2.4倍延迟并提高8.0-9.5个百分点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21475 2026-03-24 cs.AI 70%

Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems

统一-MAS:通用领域节点生成以增强自动多智能体系统

Hehai Lin, Yu Yan, Zixuan Wang, Bo Xu, Sudong Wang, Weiquan Huang, Ruochen Zhao, Minzhi Li, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出统一-MAS,通过离线节点合成解耦细粒度节点实现与拓扑编排,提升多智能体系统在知识密集型领域的性能与成本效益。

Comments Code is available at https://github.com/linhh29/Unified-MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG 70%

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21177 2026-03-24 cs.LG cs.AI 62%

Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts

提示重放:通过在线重用高信号提示加速GRPO

Andrei Baroian, Rutger Berger

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI 57%

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12275 2026-03-24 cs.CL 57%

On-Policy Context Distillation for Language Models

在线策略上下文蒸馏用于语言模型

Tianzhu Ye, Li Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 57%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2603.21340 2026-03-24 cs.AI cs.DC 70%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22136 2026-03-24 cs.CL cs.DB 57%

The Semantic Ladder: A Framework for Progressive Formalization of Natural Language Content for Knowledge Graphs and AI Systems

语义阶梯:一种用于知识图谱和人工智能系统自然语言内容逐步形式化的框架

Lars Vogt

机构 * Leibniz Institute for the Analysis of Biodiversity Change (LIB)(莱布尼茨生物多样性变化分析研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语义阶梯框架,通过逐步形式化自然语言内容,解决自然语言与形式化模型之间的表示差异问题,支持知识图谱和AI系统的可扩展性和互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21315 2026-03-24 cs.LG 57%

FluidWorld: Reaction-Diffusion Dynamics as a Predictive Substrate for World Models

FluidWorld: 反应-扩散动力学作为世界模型的预测性基质

Fabien Polly

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出FluidWorld,通过反应-扩散型偏微分方程实现世界模型预测,对比Transformer和ConvLSTM基线,展示PDE在参数效率和空间结构保留上的优势。

Comments 18 pages, 16 figures, 4 tables. Code available at https://github.com/infinition/FluidWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20449 2026-03-24 cs.SE cs.AI 57%

Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents

辅助验证工具增强大语言模型代理的政策合规性

Cailin Winston, Claris Winston, René Just

机构 * University of Washington(华盛顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于SMT求解器的框架,用于确保工具增强大语言模型代理在工具使用上的政策合规性,通过将自然语言政策转化为形式逻辑约束,并在运行时检查工具调用以防止违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20264 2026-03-24 cs.PL cs.LO 50%

Can LLMs Perform Synthesis?

LLMs能否进行合成?

Derek Egolf, Yuhao Zhou, Stavros Tripakis

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2510.06638 2026-03-24 cs.CV cs.AI 83%

StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

StaR-KVQA:用于隐式知识视觉问答的结构化推理轨迹

Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang

机构 * Ant International, Ant Group(蚂蚁集团国际部,蚂蚁集团) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院) Anhui Provincial Key Laboratory of High Performance Computing(安徽省高性能计算重点实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 StaR-KVQA通过引入双路径结构化推理轨迹提升隐式知识视觉问答的准确性与推理透明度,采用自蒸馏方法构建轨迹增强数据集,无需外部检索工具,在OK-VQA基准上实现11.3%的精度提升。

Comments 8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07148 2026-03-24 cs.CL cs.AI 81%

Measuring Iterative Temporal Reasoning with Time Puzzles

用时间谜题测量迭代时间推理

Zhengxiang Wang, Zeyu Dong

机构 * Department of Linguistics & IACS(语言学系及人工智能与计算科学中心) Stony Brook University(石溪大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间谜题,一种基于约束的日期推断任务,用于评估工具辅助的迭代时间推理。研究发现,即使使用工具,模型在处理时间推理任务时仍存在可靠性不足的问题。

Comments 11 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20262 2026-03-24 q-bio.BM cs.AI cs.LG 81%

Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization

从结果数据中解码科学推理步骤以优化分子

Zequn Liu, Kehan Wu, Shufang Xie, Zekun Guo, Wei Zhang, Tao Qin, Renhe Liu, Yingce Xia

机构 * Zhongguancun Academy(中关村学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Global Health Drug Discovery Institute(全球健康药物发现研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DESRO框架,通过分析分子属性记录中的共享片段,利用LLM恢复分子优化的推理逻辑,并在15项任务中取得最高成功率,展示了从结果数据解码推理步骤的可行性。

Comments Work in progress, 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21140 2026-03-24 cs.AI 79%

ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation

ORACLE:通过约束引导的合成数据激发方法优化大语言模型的推理能力

Zhuojie Yang, Wentao Wan, Keze Wang

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ORACLE通过结合生成式模型与符号监督,实现对多步骤推理数据的细粒度验证,提升大语言模型的推理能力,在六个基准测试中表现优异。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20505 2026-03-24 cs.AI 79%

Efficient Counterfactual Reasoning in ProbLog via Single World Intervention Programs

通过单世界干预程序在ProbLog中实现高效的反事实推理

Saimun Habib, Vaishak Belle, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) The MITRE Corporation(MITRE公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出单世界干预程序(SWIPs)用于ProbLog中的反事实推理,通过将ProbLog子句分为观测和固定部分,减少计算复杂度并提升推理可靠性,实验表明在大规模数据上推理时间减少35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21145 2026-03-24 cs.DC cs.AI cs.LG cs.SC 62%

NeSy-Edge: Neuro-Symbolic Trustworthy Self-Healing in the Computing Continuum

NeSy-Edge:神经符号可信自愈在计算连续体中的应用

Peihan Ye, Alfreds Lapkovskis, Alaa Saleh, Qiyang Zhang, Praveen Kumar Donta

机构 * Department of Computer Systems and Sciences(计算机系统与科学系) University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NeSy-Edge框架,通过边缘优先设计,在资源受限的边缘节点进行本地感知与推理,结合云模型进行最终诊断,实现计算连续体中的可信自愈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01082 2026-03-24 cs.AI 57%

EvoOpt-LLM: Evolving industrial optimization models with large language models

EvoOpt-LLM:利用大语言模型演化工业优化模型

Yiliu He, Tianle Li, Binghao Ji, Zhiyuan Liu, Di Huang

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出EvoOpt-LLM框架,通过大语言模型实现工业优化建模的全流程自动化,包括自动建模、动态业务约束注入和端到端变量剪枝,提升求解效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21802 2026-03-24 cs.LO cs.MA 50%

Modal Logic for Distributed Trust

分布式信任的模态逻辑

Niels Voorneveld, Peeter Laud

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种用于多智能体系统信任推理的方法,通过定义描述通信协议的语言及信任假设,利用模态逻辑建模网络中智能体的信念与通信,探讨信息共享与跨网络信任泛化机制。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 40 篇

2603.21272 2026-03-24 cs.AI cs.CL cs.DS cs.LG 85%

The Library Theorem: How External Organization Governs Agentic Reasoning Capacity

图书馆定理:外部组织如何支配代理推理能力

Zachary F. Mainen

机构 * Champalimaud Foundation(Champalimaud基金会)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了外部组织对代理推理能力的影响,通过实验验证了索引外部记忆的代理在检索效率上的优势,并指出语言模型在索引构建与导航协议执行中的分离需求。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20198 2026-03-24 cs.CR cs.CV cs.LG 83%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21162 2026-03-24 cs.AI cs.LG 81%

Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning

重新审视用于大语言模型的树搜索:Gumbel与顺序削减用于可扩展的推理

Leonid Ugadiarov, Yuri Kuratov, Aleksandr Panov, Alexey Skrynnik

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReSCALE,通过将Gumbel采样和顺序削减替代传统方法,实现大语言模型在推理中的可扩展推理能力提升,解决了搜索预算增加时准确率下降的问题。

Comments The paper has been accepted to the ICAPS-2026 conference. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21696 2026-03-24 cs.AI 79%

MIND: Multi-agent inference for negotiation dialogue in travel planning

MIND:用于旅行规划谈判对话的多智能体推理

Hunmin Do, Taejun Yoon, Kiyong Jung

机构 * School of Mechanical Engineering, Sungkyunkwan University(成均馆大学机械工程学院) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系) Department of Software, Sungkyunkwan University(成均馆大学软件系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 MIND通过理论思维框架模拟旅行者异质偏好下的共识建立,通过战略评估阶段以90.2%准确率推断对手意愿,实验显示其在高意愿命中率和辩论命中率上分别提升20.5%和30.7%。

Comments Accepted at ICLR 2026 Workshop (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22127 2026-03-24 eess.SY cs.SY 78%

DQN Based Joint UAV Trajectory and Association Planning in NTN Assisted Networks

基于DQN的NTN辅助网络中无人机轨迹与关联规划

Afsoon Alidadi Shamsabadi, Cosmas Mwaba, Thomas Nugent, Jie Gao, Pablo Madoery, Halim Yanikomeroglu, Subhadeep Pal

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于DQN的联合无人机轨迹与关联规划算法,旨在降低能耗、减少切换频率和断连问题,通过整合地球静止轨道网络架构实现无缝无人机连接。

详情

展开后加载摘要…

URL PDF HTML 收藏