arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2504.13941 2026-03-17 cs.LG cs.AI 88%

Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning

Nemotron-CrossThink: 在数学推理之外实现自学习的扩展

Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NEMOTRON-CROSSTHINK框架,通过整合多领域数据提升推理泛化能力,改进数学和非数学任务的准确性与效率。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG 87%

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06460 2026-03-17 cs.CL 86%

Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context

LLMs能否通过反向表现模拟人物角色?一种针对数学推理情境中反事实指令跟随的系统性调查

Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出首个评估LLM反事实指令跟随能力的基准数据集,发现主流模型在模拟反向表现人物时表现不佳,揭示了反事实指令跟随的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06632 2026-03-17 cs.LG cs.AI cs.CL 82%

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

从简单到困难的任务课程强化学习提升大语言模型推理能力

Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, Shuiwang Ji

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出E2H Reasoner方法,通过从易到难的任务调度提升LLM推理能力,理论证明其收敛性并展示更少样本需求,实验显示在多个领域显著提升小型LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12284 2026-03-17 cs.AI cs.CL 81%

Shorten After You're Right: Lazy Length Penalties for Reasoning RL

在正确后缩短:用于推理RL的懒惰长度惩罚

Danlong Yuan, Tian Xie, Shaohan Huang, Zhuocheng Gong, Huishuai Zhang, Chong Luo, Furu Wei, Dongyan Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出三种集成到大推理模型强化学习过程中的奖励设计,通过减少响应长度而不增加训练阶段,实验证明在逻辑推理和数学问题中均显著缩短响应长度并保持或提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14041 2026-03-17 cs.AI 79%

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

GRPO与反思奖励在大语言模型数学推理中的应用

Zhijie Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。

Journal ref Applied and Computational Engineering 154 161-166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00410 2026-03-17 cs.LG 79%

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

共奖励:用于大型语言模型中激发推理的稳定自监督强化学习

Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Co-rewarding框架,通过引入互补监督提升训练稳定性,通过对比一致性和模型蒸馏方法,在多个数学推理基准上实现性能提升,尤其在Llama-3.2-3B-Instruct上表现突出。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI 79%

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13023 2026-03-17 cs.SE cs.AI cs.CL 62%

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env:大规模开放软件工程环境合成

Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13790 2026-03-17 cs.LG cs.CL 62%

Greedy Information Projection for LLM Data Selection

贪心信息投影用于大语言模型数据选择

Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出贪心信息投影框架,通过最大化子集与任务查询信号的互信息,平衡质量与多样性,高效选择数据集进行微调。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI 62%

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15617 2026-03-17 cs.LG 57%

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15351 2026-03-17 cs.AI cs.MA 57%

PMAx: An Agentic Framework for AI-Driven Process Mining

PMAx:一种用于AI驱动流程挖掘的代理框架

Anton Antonov, Humam Kourani, Alessandro Berti, Gyunam Park, Wil M. P. van der Aalst

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) RWTH Aachen University(亚琛工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PMAx通过隐私保护的多代理架构,使非技术人员能将业务问题转化为可靠流程洞察,避免LLM的确定性推理和隐私泄露问题。

Comments Submitted to EMMSAD 2026 (tool demonstration track), under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15340 2026-03-17 cs.CL stat.ML 57%

DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models

DOS:基于依赖关系的掩码扩散语言模型采样器

Xueyu Zhou, Yangrong Hu, Jian Huang

机构 * Department of Data Science and AI(数据科学与人工智能系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 50%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 11 篇

2603.13443 2026-03-17 cs.SE cs.AI cs.PL 83%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13372 2026-03-17 cs.AI cs.LG 81%

The ARC of Progress towards AGI: A Living Survey of Abstraction and Reasoning

为AGI进步的ARC:抽象与推理的活体调查

Sahar Vahdati, Andrei Aioanei, Haridhra Suresh, Jens Lehmann

机构 * TIB - Leibniz Information Centre for Science and Technology(TIB - 科学技术信息研究中心) L3S Research Center, Leibniz University of Hannover(L3S研究所以汉诺威莱布尼茨大学) Dresden University of Technology, Amazon (work done outside of Amazon)(德累斯顿技术大学,亚马逊(非亚马逊工作))

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析三个版本的82种方法及ARC Prize竞赛,揭示了不同范式在版本间性能下降的规律,指出组合泛化能力的局限性,并强调测试时适应和精炼循环的重要性。

Comments Submitted to ACM Computing Surveys. Living survey website: https://nimi-ai.com/arc-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14703 2026-03-17 cs.SE cs.AI 79%

Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization

超越局部代码优化:软件系统优化的多智能体推理

Huiyun Peng, Parth Vinod Patil, Antonio Zhong Qiu, George K. Thiruvathukal, James C. Davis

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出多智能体框架,通过整合控制流、数据流与架构依赖信号,实现微服务系统的整体优化,提升吞吐量和响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14312 2026-03-17 cs.AI cond-mat.dis-nn cs.LG cs.MA q-bio.BM 62%

Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact Exchange

自主代理通过涌现式物品交换协调分布式发现

Fiona Y. Wang, Lee Marom, Subhadeep Pal, Rachel K. Luu, Wei Lu, Jaime A. Berkovich, Markus J. Buehler

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出ScienceClaw + Infinite框架,通过自主代理在无中央协调下进行科学探究,展示异构工具链、代理间涌现式收敛及可追溯推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14087 2026-03-17 cs.LG cs.CL 62%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14007 2026-03-17 cs.AI 57%

Formal Abductive Explanations for Navigating Mental Health Help-Seeking and Diversity in Tech Workplaces

形式归纳解释用于导航心理健康求助与科技职场多样性

Belona Sonna, Alain Momo, Alban Grastien

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出形式归纳解释框架,用于系统揭示AI对科技职场心理健康求助预测的合理性。通过计算模型输出的严谨解释,支持选择适合不同心理科目的模型,并确保伦理稳健的救济计划。同时,明确考察性别等敏感属性对模型决策的影响,以支持公平性评估。

Comments Appeared in the Proceedings of the Empowering Women of Colour in AI-Driven Mental Health Research at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13603 2026-03-17 cs.DB cs.AI 57%

The Equivalence Theorem: First-Class Relationships for Structurally Complete Database Systems

等价定理:结构完备数据库系统的第一类关系

Matthew Alford

机构 * Network Service Group(网络服务组)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文证明了结构完备的知识表示需要四种互为依赖的能力,提出ATCH框架,并建立了SQL与TypeDB的表达性层级。

Comments 35 pages, 2 figures, Lean 4 formalization at https://github.com/Network-Services-Group/equivalence-theorem-lean4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 57%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02990 2026-03-17 cs.LG 57%

Learning to Repair Lean Proofs from Compiler Feedback

从编译器反馈中学习修复Lean证明

Evan Wang, Simon Chess, Daniel Lee, Siyuan Ge, Ajit Mallavarapu, Jarod Alper, Vasily Ilin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了将Lean证明修复作为监督学习问题,提出APRIL数据集,通过系统生成的证明错误与编译器诊断配对,提升修复准确性和反馈条件推理能力。

Comments 15 pages, 6 figures

Journal ref ICLR VerifAI Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06436 2026-03-17 cs.MA 50%

R3R: Decentralized Multi-Agent Collision Avoidance with Infinite-Horizon Safety

R3R:具有无限时间安全性的去中心化多智能体避障

Thomas Marshall Vielmetti, Devansh R. Agrawal, Dimitra Panagou

专题命中 代码与定理证明 :planning(abstract)

AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。

Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 50%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 13 篇

2603.15317 2026-03-17 cs.CL 79%

PYTHEN: A Flexible Framework for Legal Reasoning in Python

PYTHEN:一种用于法律推理的灵活框架

Ha-Thanh Nguyen, Ken Satoh

机构 * Center for Juris-Informatics, ROIS-DS, Tokyo, Japan(法律信息中心,ROIS-DS,东京,日本) Research and Development Center for Large Language Models, NII, Tokyo, Japan(大语言模型研究开发中心,NII,东京,日本)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文介绍PYTHEN,一种基于Python的新型法律推理框架,通过灵活的语法支持法律规则、条件和例外的表示,结合Python内置函数提升灵活性,并探讨其在自动形式化和下一代法律AI系统中的应用。

Comments Accepted at JURISIN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 79%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06117 2026-03-17 cs.LG 79%

The Active Discoverer Framework: Towards Autonomous Physics Reasoning through Neuro-Symbolic LaTeX Synthesis

主动发现框架:通过神经符号LaTeX合成实现自主物理推理

Hyunjun Jeon

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出主动发现框架,通过神经符号LaTeX合成实现自主物理推理,解决神经网络在大规模计算中的精度问题,并验证其在物理常数推导中的有效性。

Comments V4 Coming S00N :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13266 2026-03-17 cs.AI 79%

Multi-hop Reasoning and Retrieval in Embedding Space: Leveraging Large Language Models with Knowledge

嵌入空间中的多跳推理与检索:利用大型语言模型与知识

Lihui Liu

机构 * Wayne State University(韦恩州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EMBRAG框架,通过生成基于知识图谱的逻辑规则并在嵌入空间中推理,提升知识图谱问答任务的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏