arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 16 篇

2606.29985 2026-06-30 cs.CL 86%

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30128 2026-06-30 cs.AI cs.CL 86%

Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters

冗长的思维链真的有用吗?来自分布内证据表明,内容而非长度才是关键

Wenlong Wang, Fergal Reid

机构 * Fin AI Research(Fin AI研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 通过分布内采样和受控干预实验,发现思维链中额外标记的长度不影响推理准确性,真正起作用的是标记携带的推理和验证内容。

Comments ICML Workshop on Efficient Multimodal Question Answering (EMM-QA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL 82%

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02003 2026-06-30 cs.CL cs.HC 81%

HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

HoT: 用于从输入中引用支持事实的高亮推理链

Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(亚伯拉罕大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09883 2026-06-30 cs.LG cs.AI 81%

Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning

超越缩放定律:一种数据高效的蒸馏框架用于推理

Xiaojun Wu, Xiaoguang Jiang, Huiyang Li, Jucai Zhai, Dengfeng Liu, Qiaobo Hao, Huang Liu, Zhiguo Yang, Ji Xie, Ninglun Gu, Jin Yang, Kailai Zhang, Yelun Bao, Jun Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据高效的蒸馏框架DED,通过优化推理蒸馏的帕累托前沿,提升推理能力而不依赖大规模数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29971 2026-06-30 cs.LG 79%

NeuReasoner: Theory-grounded Mapping of Reasoning Elicitation Boundaries

NeuReasoner: 理论驱动的推理激发边界映射

Aydin Javadov, Shyngys Aitkazinov, Tobias Hoesli, Florian von Wangenheim, Bjoern Schuller, Joseph Ollier

机构 * ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29929 2026-06-30 cs.AI 79%

HippoSpark: An On-Demand Experience System for LLM Reasoning

HippoSpark: 一种用于LLM推理的按需经验系统

Jingyao Liu, Danling Meng, Chen Huang, Yukun Yan, Zhenghao Liu, Wenqiang Lei, See-Kiong Ng, Maosong Sun

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HippoSpark状态级经验系统,在推理过程中按需检索局部瓶颈的精确指导,在数学、科学和编程基准上优于标准提示和任务级经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02804 2026-06-30 cs.CL 79%

Multimodal Mathematical Reasoning with Diverse Solving Perspective

多模态数学推理与多样化的解题视角

Wenhao Shi, Zhiqiang Hu, Yi Bin, Guoqing Wang, Xing Xu, Yang Yang, See-Kiong Ng

机构 * Tongji University(同济大学) National University of Singapore(新加坡国立大学) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Tencent(腾讯) Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24021 2026-06-30 cs.AI math.AP 70%

QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems

QED:一个用于生成开放问题数学证明的开源多智能体系统

Chenyang An, Qihao Ye, Minghao Pan, Jiayaun Zhang

专题命中 数学推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出开源多智能体系统QED,通过分解规划、生成论证和验证正确性的流水线,自动将研究问题转化为完整数学证明,并在18个研究级项目中成功生成5篇原创工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL 70%

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28831 2026-06-30 cs.LG cs.AI 62%

HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

HARD-KV: 面向解码时KV压缩的头自适应正则化

Yuxuan Yang, Feiyang Ren, Bowen Zeng, Dalin Zhang, Jinpeng Chen, Gang Chen, Huan Li

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出HARD-KV框架,通过级联缓存层次和对数校准机制,解决头自适应压缩算法与静态内存模式的不匹配,实现高效长上下文推理。

Comments 25 pages, ICML 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-06-30 cs.MA cs.AI cs.LG 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI 57%

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL 57%

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15251 2026-06-30 cs.CL 57%

The Effect of Scripts and Formats on LLM Numeracy

脚本和格式对LLM数理能力的影响

Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏