arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 223 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 16 篇

2606.29985 2026-06-30 cs.CL 86%

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30128 2026-06-30 cs.AI cs.CL 86%

Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters

冗长的思维链真的有用吗?来自分布内证据表明,内容而非长度才是关键

Wenlong Wang, Fergal Reid

机构 * Fin AI Research(Fin AI研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 通过分布内采样和受控干预实验,发现思维链中额外标记的长度不影响推理准确性,真正起作用的是标记携带的推理和验证内容。

Comments ICML Workshop on Efficient Multimodal Question Answering (EMM-QA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL 82%

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02003 2026-06-30 cs.CL cs.HC 81%

HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

HoT: 用于从输入中引用支持事实的高亮推理链

Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(亚伯拉罕大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09883 2026-06-30 cs.LG cs.AI 81%

Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning

超越缩放定律:一种数据高效的蒸馏框架用于推理

Xiaojun Wu, Xiaoguang Jiang, Huiyang Li, Jucai Zhai, Dengfeng Liu, Qiaobo Hao, Huang Liu, Zhiguo Yang, Ji Xie, Ninglun Gu, Jin Yang, Kailai Zhang, Yelun Bao, Jun Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据高效的蒸馏框架DED,通过优化推理蒸馏的帕累托前沿,提升推理能力而不依赖大规模数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29971 2026-06-30 cs.LG 79%

NeuReasoner: Theory-grounded Mapping of Reasoning Elicitation Boundaries

NeuReasoner: 理论驱动的推理激发边界映射

Aydin Javadov, Shyngys Aitkazinov, Tobias Hoesli, Florian von Wangenheim, Bjoern Schuller, Joseph Ollier

机构 * ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29929 2026-06-30 cs.AI 79%

HippoSpark: An On-Demand Experience System for LLM Reasoning

HippoSpark: 一种用于LLM推理的按需经验系统

Jingyao Liu, Danling Meng, Chen Huang, Yukun Yan, Zhenghao Liu, Wenqiang Lei, See-Kiong Ng, Maosong Sun

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02804 2026-06-30 cs.CL 79%

Multimodal Mathematical Reasoning with Diverse Solving Perspective

多模态数学推理与多样化的解题视角

Wenhao Shi, Zhiqiang Hu, Yi Bin, Guoqing Wang, Xing Xu, Yang Yang, See-Kiong Ng

机构 * Tongji University(同济大学) National University of Singapore(新加坡国立大学) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Tencent(腾讯) Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24021 2026-06-30 cs.AI math.AP 70%

QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems

QED:一个用于生成开放问题数学证明的开源多智能体系统

Chenyang An, Qihao Ye, Minghao Pan, Jiayaun Zhang

专题命中 数学推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出开源多智能体系统QED,通过分解规划、生成论证和验证正确性的流水线,自动将研究问题转化为完整数学证明,并在18个研究级项目中成功生成5篇原创工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL 70%

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28831 2026-06-30 cs.LG cs.AI 62%

HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

HARD-KV: 面向解码时KV压缩的头自适应正则化

Yuxuan Yang, Feiyang Ren, Bowen Zeng, Dalin Zhang, Jinpeng Chen, Gang Chen, Huan Li

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出HARD-KV框架,通过级联缓存层次和对数校准机制,解决头自适应压缩算法与静态内存模式的不匹配,实现高效长上下文推理。

Comments 25 pages, ICML 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-06-30 cs.MA cs.AI cs.LG 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI 57%

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL 57%

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15251 2026-06-30 cs.CL 57%

The Effect of Scripts and Formats on LLM Numeracy

脚本和格式对LLM数理能力的影响

Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 10 篇

2506.13932 2026-06-30 cs.SE cs.AI 85%

Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action

代码推理用于软件工程任务:调查与呼吁行动

Saurabh Pujar, Ira Ceka, Irene Manotas, Gail Kaiser, Baishakhi Ray, Shyam Ramji

机构 * IBM Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文调查代码推理技术,探讨其在软件工程任务中的影响,提出未来研究方向。

Comments Published in Transactions on Machine Learning Research (06/2026) 40 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28841 2026-06-30 cs.LO cs.AI cs.CL 73%

LAMP: Lean-based Agentic framework with MCP and Proof Repair

LAMP: 基于 Lean 的 MCP 与证明修复智能体框架

Santhana Srinivasan R, Maithilee Patawar

机构 * Indian Institute of Information Technology, Design and Manufacturing, Kancheepuram(印度信息与设计制造理工学院,卡纳切普拉姆)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出 LAMP 多智能体框架,通过推理时提供结构化领域知识(本体)而非微调,在 Lean 4 中合成内核验证的证明,在组合学词领域定理上达到 96.7% 的验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29687 2026-06-30 quant-ph cs.AI cs.LG cs.LO math.OC 62%

A Machine-Verified Proof of a Quantum-Optimization Conjecture

一个量子优化猜想的机器验证证明

Uri Kol, Maor Ben-Shahar, Kfir Sulimany, Dirk Englund

机构 * Center of Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学中心) MIT Center for Theoretical Physics - a Leinweber Institute(麻省理工学院理论物理中心 - 莱因韦伯研究所) Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型Claude Fable 5发现证明,并通过Lean 4证明助手端到端验证了Farhi-Goldstone-Gutmann猜想,即深度p的量子近似优化算法在环上的近似比恰好为(2p+1)/(2p+2)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29091 2026-06-30 cs.LG cs.AI cs.DB 62%

Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models

统计不可区分,操作上截然不同:表格基础模型的形式化障碍

Tassilo Klein, Johannes Hoffart

机构 * SAP SE(SAP公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出操作图灵测试,证明仅基于值的表格模型无法区分合法与违规数据库状态,而操作审计特征可突破该障碍,揭示可识别性而非模型容量是根本限制。

Comments Accepted at the 2nd ICML Workshop on Foundation Models for Structured Data, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28747 2026-06-30 cs.AI cs.LG 62%

Self-Supervised Theorem Discovery in a Formal Axiomatic System

形式化公理系统中的自监督定理发现

Kazuki Ota, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo, Japan(东京大学,日本) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。

Comments AI for Math Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30587 2026-06-30 cs.CR cs.AI 57%

Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

言语胜于代码:探究基于LLM的代码漏洞检测中的认知启发式

Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik

机构 * BRAC University(布拉德大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文首次系统探究认知启发式对LLM代码漏洞检测的影响,提出控制框架,发现所有评估模型均易受光环、框架和锚定效应影响,且语义推理型漏洞更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28512 2026-06-30 cs.CL 57%

On Compositional Learning Behaviours in Formal Mathematics

论形式数学中的组合学习行为

Kevin Yandoka Denamganaï

机构 * University of York(约克大学)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出 S2B-LM 基准,通过去除数值处理混淆并添加思维链框架来评估组合学习行为(CLB),发现 CLB 能力对于形式数学验证的困难部分必要但不充分。

Comments Accepted at AI4Math Workshop @ ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06359 2026-06-30 cs.AI cs.MA 57%

Modelling Human Values for Value-Aware Multi-Agent Systems

为价值感知多智能体系统建模人类价值观

Nardine Osman, Mark d'Inverno

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个形式化框架,用于表示人类价值观,以支持多智能体系统中的价值感知推理。通过社会心理学研究,建立价值关系和重要性模型,实现行为评估和价值感知决策机制。

Comments arXiv admin note: text overlap with arXiv:2305.02748

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04611 2026-06-30 cs.CR cs.SE 50%

PBFuzz: Agentic Directed Fuzzing for PoV Generation

PBFuzz:面向漏洞证明的代理引导模糊测试

Haochen Zeng, Andrew Bao, Jiajun Cheng, Chengyu Song

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 PBFuzz通过模拟人类专家流程,自动提取语义约束并高效生成漏洞证明输入,实验表明其在效率和漏洞触发性能上优于现有方法。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18879 2026-06-30 cs.PL 50%

Adaptive Shielding via Parametric Safety Proofs

基于参数安全证明的自适应防护

Yao Feng, Jun Zhu, André Platzer, Jonathan Laurent

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。

Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 12 篇

2605.24844 2026-06-30 cs.AI cs.CL 88%

Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning

Geo-Expert: 通过参数高效微调实现专家级地质推理

Chenyou Guo, Zongqi Liu, Yizhou Zhang, Zhaorui Jiang, Ze Liu

机构 * Ocean University of China(中国海洋大学) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Geo-Expert,通过参数高效微调(LoRA)在定制高质量指令数据集上微调小规模语言模型,在专门的地质推理基准Geo-Eval上,8B模型超越70B通用模型和GPT-4o,32B模型接近前沿推理模型。

Comments 11 pages, 1 figure, 3 tables. Accepted at ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29354 2026-06-30 cs.AI cs.NE 87%

When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning

当大语言模型发展语言:用于高效多智能体推理的符号通信

Zhengqi Pei, Qingming Huang, Shuhui Wang

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出CLSR框架,让多个LLM智能体自主发明和演化紧凑符号语言,通过路由器自适应选择以优化准确率与token成本的权衡,在保持准确率的同时将推理token数减少3-6倍。

Comments ICML2026 Regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 83%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29481 2026-06-30 cs.CL cs.AI 81%

To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation

推理还是捏造:通过提示锚定的成对聚合实现无捷径推理

Jiuheng Lin, Chen Zhang, Yansong Feng

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对强化学习前数据重叠导致模型利用捷径记忆答案的问题,提出HIPPO框架,通过提示注入触发重叠行为并利用成对奖励模型区分真实推理与捷径合理化,显著提升推理真实性及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏