arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-14 至 2026-07-14 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 16 篇

2606.31779 2026-07-14 cs.LG cs.CL 版本更新 90%

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

弥合潜在推理与显式推理之间的差距:循环Transformer

Ying Fan, Anej Svete, Kangwook Lee

机构 * UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) ETH Zürich(苏黎世联邦理工学院) KRAFTON(魁匠团) Ludo Robotics

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出LOTUS方法,利用循环Transformer在潜在空间进行多步推理,通过并行监督潜在块上的CoT令牌,首次在3B规模弥合与显式CoT的差距,并将推理延迟降低2.5-6.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11408 2026-07-14 cs.CL cs.AI 86%

KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?

KisMATH: 大型语言模型是否具有数学推理中隐含结构的知识?

Soumadeep Saha, Akshay Chaturvedi, Saptarshi Saha, Utpal Garain, Nicholas Asher

机构 * ISI Kolkata, India(印度 ISI 学院) IRIT(IRIT 研究所) LINAGORA Labs(LINAGORA 实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 KisMATH通过构建因果链式思维图,研究大型语言模型在数学推理中隐含结构的知识与因果依赖关系。

Comments Pre-print; Accepted to TACL

Journal ref Transactions of the Association for Computational Linguistics (2026) 14

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17993 2026-07-14 cs.LG cs.AI 版本更新 84%

Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers

Turbo Connection: 从高层到低层的信息流推理

Mohan Tang, Sidi Lu

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Turbo Conn通过反向连接增强LLM推理能力,实现任务性能显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10114 2026-07-14 cs.CL cs.AI cs.LG 新提交 82%

Cost of Reasoning in non-English Languages: A Case Study on Japanese

非英语语言的推理成本:以日语为例

Yuu Jinnai

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练日语推理模型的可行性,开发Qwen - 3 - Swallow - 8B的日语推理变体并用GRPO训练,在多基准测试中发现推理语言控制可行,但性能与英语推理基线相当,在日本文化基准上表现不如基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01331 2026-07-14 cs.CL cs.AI cs.LG 版本更新 82%

MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models

MetaState: 持久工作记忆增强离散扩散语言模型的推理能力

Kejing Xia, Mingzhe Li, Lixuan Wei, Zhenbang Du, Xiangchi Yuan, Dachuan Shi, Qirui Jin, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MetaState通过引入轻量级循环增强模块,为冻结的离散扩散语言模型提供持久固定大小的工作记忆,提升推理性能,平均提升4.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 82%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 79%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10123 2026-07-14 cs.LG cs.AI cs.CL 版本更新 75%

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

Nested-ReFT:通过离策略展开实现大语言模型微调的高效强化学习

Maxime Heuillet, Yufei Cui, Boxing Chen, Audrey Durand, Prasanna Parthasarathi

机构 * Mila - Québec AI Institute, Canada(魁北克人工智能研究所) Huawei Noah's Ark Lab (Montreal Research Center), Canada(华为诺亚实验室(蒙特利尔研究中心)) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型在数学推理等领域的高级推理难题,提出Nested-ReFT框架,利用离策略展开及动态层跳过降低训练推理成本,经理论与实证分析验证其有效性,还探索偏差缓解变体以维持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 62%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11052 2026-07-14 cs.LG cs.CL 新提交 62%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交 62%

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17932 2026-07-14 cs.CL cs.AI 版本更新 62%

Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

在扩散大型语言模型中进行提示压缩:在LLDA上评估LLMLingua-2

Sterling Huang, Abigayle Brown, Jiyoo Noh, Jiakang Xu, Wantong Huo, Kaung Myat Kyaw, Jonathan Chan

机构 * University of Toronto(多伦多大学) King Mongkut’s University of Technology Thonburi(泰国科技理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提示压缩在扩散大型语言模型中的有效性,通过在LLDA上评估LLMLingua-2,发现提示压缩在数学推理任务中效果不佳,而摘要任务相对稳健,表明为扩散模型设计的提示压缩方法并不适用于所有场景。

Comments Accepted to appear in The 14th International Conference on Advances in Information Technology (IAIT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07372 2026-07-14 cs.CL cs.AI 版本更新 62%

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交 57%

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10110 2026-07-14 cs.AI 新提交 57%

Looped State-Space Language Models with Adaptive Exit-State Selection

具有自适应退出状态选择的循环状态空间语言模型

Zhenxuan Yu, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa

机构 * Rikkyo University(立教大学) The University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究循环状态空间语言模型在推理任务及预训练中的表现,采用循环曼巴等架构,在推理任务中优于非循环基线,预训练时在下游基准测试有竞争力,适配退出门后在中间深度提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09839 2026-07-14 cs.AI cs.CV cs.HC 新提交 57%

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

探索用于生成高质量数学视觉辅助工具的智能工作流程

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院) Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对中学数学图表可靠生成难的问题,引入智能工作流程,让 LLM 智能体评估并迭代改进生成的视觉效果,通过探索性评估确定改进关键领域,初步证明可提高 AI 生成数学图表的可靠性和教育价值。

Comments 13 pages, 9 figures. Exploratory course project on agentic workflows for generating and evaluating K 12 mathematical diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏