arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-26 至 2026-02-26 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2505.13529 2026-02-26 cs.AI cs.CL cs.LG 85%

BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs

BARREL:面向事实性和可靠性的边界感知推理

Junxiao Yang, Jinzhe Tu, Haoran Liu, Xiaoce Wang, Chujie Zheng, Zhexin Zhang, Shiyao Cui, Caishun Chen, Tiantian He, Hongning Wang, Yew-Soon Ong, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,清华大学数据科学与技术研究院) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,高性能计算研究所,新加坡科技研究局) The College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARREL通过促进简洁且边界感知的事实推理,提升了大型推理模型的事实可靠性,实验显示其在可靠性方面有显著提升,同时保持了与传统微调模型相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06692 2026-02-26 cs.CL cs.AI 81%

InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models

InftyThink: 突破大型语言模型长上下文推理的长度限制

Yuchen Yan, Yongliang Shen, Yang Liu, Jin Jiang, Mengdi Zhang, Jian Shao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 InftyThink通过迭代推理与中间摘要机制,突破大型语言模型长上下文推理的长度限制,提升推理深度与效率。

Comments ICLR 2026: https://openreview.net/forum?id=T1h5em349L Project Page: https://zju-real.github.io/InftyThink Code: https://github.com/ZJU-REAL/InftyThink

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11684 2026-02-26 cs.CL cs.AI 81%

MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task

MathFimer: 通过填空中间任务扩展推理步骤以增强数学推理

Yuchen Yan, Yongliang Shen, Yang Liu, Jin Jiang, Xin Xu, Mengdi Zhang, Jian Shao, Yueting Zhuang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MathFimer通过填空中间任务扩展推理步骤,提升大语言模型的数学推理能力,无需依赖强大外部模型或昂贵计算资源。

Comments ICLR 2026: https://openreview.net/forum?id=14i2wzPPfn

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22193 2026-02-26 cs.CL 79%

Improving Parametric Knowledge Access in Reasoning Language Models

提升推理语言模型的参数知识访问能力

Melody Ma, John Hewitt

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过强化学习训练,提升推理语言模型在参数知识访问上的能力,改进知识回忆和问答任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05077 2026-02-26 cs.CL cs.AI 76%

Slm-mux: Orchestrating small language models for reasoning

Slm-mux: 通过协调小型语言模型进行推理

Chenyu Wang, Zishen Wan, Hao Kang, Emma Chen, Zhiqiang Xie, Tushar Krishna, Vijay Janapa Reddi, Yilun Du

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SLM-MUX通过协调多个小型语言模型提升推理准确性,实现比单个模型更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21269 2026-02-26 cs.LG cs.AI stat.ML 62%

Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space

群体正交化策略优化:将群体策略优化视为希尔伯特空间中的正交投影

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过正交投影在希尔伯特空间中优化群体策略,实现精确稀疏性和稳定梯度动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10947 2026-02-26 cs.AI cs.LG 62%

Spurious Rewards: Rethinking Training Signals in RLVR

虚假奖励:重新思考强化学习中的训练信号

Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer

机构 * University of Washington, Seattle, WA, USA(华盛顿大学) Allen Institute for Artificial Intelligence, Seattle, WA, USA(人工智能研究院) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,即使使用随机分配的虚假奖励,强化学习方法也能在某些模型上显著提升性能,凸显了验证训练信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21371 2026-02-26 cs.LG 57%

Interleaved Head Attention

交错头部注意力

Sai Surya Duvvuri, Chanakya Ekbote, Rachit Bansal, Rishabh Tiwari, Devvrit Khatri, David Brandfonbrener, Paul Liang, Inderjit Dhillon, Manzil Zaheer

机构 * Meta UT Austin(德克萨斯大学) UC Berkeley(伯克利大学) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 交错头部注意力通过构造伪头实现跨头混合,提升多步推理效率,在多项式任务和顺序敏感任务中参数效率提高,实测在RULER和OpenThoughts上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏