arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-26 至 2026-03-26 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 84%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16917 2026-03-26 cs.AI cs.CL cs.LG 82%

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

生成对抗推理器:通过对抗性强化学习增强大语言模型推理

Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成对抗推理器,通过对抗性强化学习联合训练LLM推理器和判别器,提升推理质量与准确性。

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14751 2026-03-26 cs.LG cs.AI 73%

Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries

超越多令牌预测:通过未来摘要预训练语言模型

Divyat Mahajan, Sachin Goyal, Badr Youbi Idrissi, Mohammad Pezeshki, Ioannis Mitliagkas, David Lopez-Paz, Kartik Ahuja

机构 * Carnegie Mellon University(卡内基梅隆大学) FAIR at Meta(Meta的FAIR)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出未来摘要预测(FSP)方法,通过训练辅助头预测紧凑的长期未来表示,提升长形式生成能力,在数学、推理和编码基准测试中优于NTP和MTP。

Comments Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16485 2026-03-26 cs.CL cs.AI cs.MA 62%

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

思想团队:通过协调工具调用实现代理系统高效测试时扩展

Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao

机构 * Imperial College London(帝国学院伦敦) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Team-of-Thoughts框架,通过协调工具调用实现异构代理系统在测试时的高效扩展,通过动态激活最兼容的代理提升数学推理和代码生成任务的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23871 2026-03-26 cs.LG cs.AI 62%

HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation

HDPO:通过特权自蒸馏的混合蒸馏策略优化

Ken Ding

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HDPO通过结合强化学习与特权自蒸馏解决RL在数学推理中遇到的'悬崖'提示问题,提升覆盖指标并保持贪婪准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19345 2026-03-26 cs.LG cs.AI 62%

Smooth Gate Functions for Soft Advantage Policy Optimization

用于软优势策略优化的平滑门函数

Egor Denisov, Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Institute for Artificial Intelligence, Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学人工智能研究所) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过平滑门函数提升策略优化稳定性和模型性能,分析了不同门函数在数学推理任务中的实验结果,为大语言模型训练提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 62%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24375 2026-03-26 cs.CL 57%

Towards Reward Modeling for AI Tutors in Math Mistake Remediation

迈向数学错误纠正中的人工智能导师的奖励建模

Kseniia Petukhova, Ekaterina Kochmar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于人类偏好的人工智能导师奖励建模方法,通过合成数据和加权和数据提升模型准确性,达到0.74的配对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 57%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏