arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-25 至 2026-03-25 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2603.22871 2026-03-25 cs.AI cs.LG math.DS 81%

Dynamical Systems Theory Behind a Hierarchical Reasoning Model

层次推理模型背后的动力系统理论

Vasiliy A. Es'kin, Mikhail E. Smorkalov

机构 * Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系) Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心) Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Contraction Mapping Model,通过将离散递归推理转化为连续的NODEs/NSDEs,提供数学严谨且稳定的推理引擎,在Sudoku-Extreme基准测试中取得93.7%的准确率,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 79%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23414 2026-03-25 cs.LG cs.AI 73%

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练

Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23004 2026-03-25 cs.AI cs.LG 62%

Can Large Language Models Reason and Optimize Under Constraints?

大型语言模型能否在约束下进行推理和优化?

Fabien Bernier, Salah Ghamizi, Pantelis Dogoulis, Maxime Cordy

机构 * SnT – University of Luxembourg(卢森堡大学SnT分校) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在最优功率流问题物理和操作约束下的推理与优化能力,发现现有模型在多数任务中表现不足,揭示了LLM在约束下结构推理的关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17074 2026-03-25 cs.LG 57%

PRISM: Demystifying Retention and Interaction in Mid-Training

PRISM:解开中期训练中保留与交互的谜团

Bharat Runwal, Ashish Agrawal, Anurag Roy, Rameswar Panda

机构 * IBM Research, MIT-IBM Watson AI Lab(IBM研究院,MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PRISM通过七种基础模型的受控实验,发现中期训练能显著提升数学、代码和科学基准测试成绩,同时保持整体性能,且数据组成比强化学习更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 57%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏