arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-14 至 2026-05-14 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2605.13165 2026-05-14 cs.CL 87%

STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes

STOP:低数据场景下长形式推理的结构化在线剪枝

Chenjun Xu, Zhennan Zhou, Zhan Su, Bill Howe, Lucy Lu Wang, Bingbing Wen

机构 * University of Washington(华盛顿大学) University of Montreal(蒙特利尔大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 STOP通过结构化在线剪枝减少低数据场景下的长形式推理生成token,同时保持准确性,提升推理效率与结构效率。

Comments 20 pages, 6 figures, 6 tables. Code available at: https://github.com/chenjux/ECN-STOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 81%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL 81%

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08504 2026-05-14 cs.CL 70%

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

一层解释所有:理解大语言模型中大规模激活现象

Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Wake Forest University(威克森林大学) Meta AI

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型中大规模激活的起源,发现ME层是大规模激活首次出现的层,并提出方法减少大规模激活的刚性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13695 2026-05-14 cs.CL cs.AI 62%

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

RTLC -- 研究、教以学、批判:一种受费曼学习技术启发的三阶段提示范式,无需微调即可提升LLM-as-judge在JudgeBench上的准确性

Andrea Morandi

机构 * Cisco(思科)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RTLC通过三阶段提示方法提升LLM在JudgeBench上的准确性,无需微调或外部工具,其核心方法包括研究、教以学和批判三个阶段,显著提升客观正确性评分的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11274 2026-05-14 cs.CL cs.LG 62%

Learning a Continue-Thinking Token for Enhanced Test-Time Scaling

学习一个持续思考标记以增强测试时扩展

Liran Ringel, Elad Tolochinsky, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术学院–以色列理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过学习专用持续思考标记来提升测试时扩展性能的方法,实验表明该方法在数学基准测试中优于固定标记方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 62%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13414 2026-05-14 cs.AI 57%

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制

Zabir Al Nazi, Shubhashis Roy Dipta

机构 * University of California, Riverside, USA(加州大学河滨分校) University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09923 2026-05-14 cs.AI 57%

expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling

expo: 通过自适应KL调节和高斯课程采样优先政策优化

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EXPO算法,通过自适应KL调节和高斯课程采样提升策略探索效率,实验表明其在数学推理任务中显著优于传统GRPO方法。

Comments Duplicate submission of arXiv:2605.11403

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00066 2026-05-14 cs.LG 57%

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

通过概率塑造的锐度引导组相对策略优化

Tue Le, Linh Ngo Van, Trung Le

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏