arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 275 篇

2608.09942 2026-08-12 cs.CL cs.AI cs.LG 新提交 93%

When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning

思维链(CoT)何时有助、何时有害:大语言模型推理中序列深度瓶颈的实证研究

Tughanbulut Kurtulush

机构 * Vistula University(维斯图拉大学)

专题命中 数学推理 :CoT(title_cn,summary_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实证发现,思维链(CoT)是带宽旁路而非通用推理增强器,在高深度推理任务中可提升大语言模型准确率,在浅层任务中冗余,其效果与任务序列深度、模型规模相关。

Comments 15 pages, 3 figures, 5 tables. Pre-registered study (OSF: https://osf.io/92jdk). Data and code: https://osf.io/hteuj

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08503 2026-08-11 cs.AI cs.CL 新提交 92%

MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models

MathShikkha:针对小型语言模型孟加拉语数学推理的仅答案与思维链监督对照研究

Rahma Simin Ali, Jawad Hossain

机构 * University at Albany(奥尔巴尼大学)

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含GPT-5.4推理依据的孟加拉语数学数据集MathShikkha,微调4个4B-7B模型,发现CoT监督对域内强骨干无增益但提升弱模型,域外及BanglaMATH基准上均优于仅答案,核心益处为语言贴合度、可审核推理及域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交 92%

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27888 2026-07-31 cs.AI 新提交 92%

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配

Qiangqiang He, Zhongheng Wu, ZiJian Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)

专题命中 数学推理 :CoT(title,title_cn);reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。

Comments 20 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04928 2026-08-06 cs.CL 新提交 92%

Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability?

思维链可监控性中“看不见即想不到”吗?

Pedro Ferreira, Wilker Aziz, Ivan Titov

机构 * University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :CoT(title,summary_cn);chain-of-thought(abstract,abstract_cn);reasoning(abstract);math reasoning(abstract)

AI总结 本研究对比显式与潜在CoT的可监控性,发现其更多取决于任务属性和模型内部访问程度,而非推理模式。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03550 2026-08-05 cs.AI 新提交 92%

Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

随着大型语言模型(LLM)性能提升,软引导开始优于思维链(CoT)提示

Denys Pushkin, Albert Q. Jiang, Aryo Lotfi, Colin Sandon, Emmanuel Abbé

专题命中 数学推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究发现,随着LLM性能提升,标准CoT提示的干扰作用凸显,推理专用模型在零样本设置下的数学推理性能优于少样本CoT提示。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13862 2026-06-15 cs.LG cs.AI cs.CL 新提交 90%

SuperThoughts: Reasoning Tokens in Superposition

SuperThoughts: 叠加中的推理令牌

Zheyang Xiong, Shivam Garg, Max Yu, Vaishnavi Shrivastava, Haoyu Zhao, Anastasios Kyrillidis, Dimitris Papailiopoulos

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Independent(独立机构) Princeton University(普林斯顿大学) Rice University(莱斯大学)

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SuperThoughts方法,通过将连续CoT令牌对压缩为单一潜在表示并利用多令牌预测模块解码,在保持训练监督的同时将推理吞吐量翻倍,实现约20-30%的CoT长度缩减且精度损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05254 2026-08-07 cs.CL cs.SC 新提交 90%

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 89%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22925 2026-07-28 cs.CL cs.AI cs.LG 新提交 89%

Not All LLM Reasoning is Visible in the Chain-of-Thought

并非所有大语言模型的推理都能在思维链中体现

Vatsal Baherwani, Tom Goldstein, Ashwinee Panda

机构 * New York University(纽约大学) University of Maryland(马里兰大学) TogetherAI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15877 2026-06-16 cs.CL cs.AI 新提交 88%

Free Energy Heuristics: Fast-And-Frugal Cognition as Active Inference Under Uncertain Precision

自由能启发式:作为不确定精度下主动推理的快速节俭认知

Alex Bogdan

机构 * Evolutionairy AI Toronto, Canada(进化人工智能(多伦多,加拿大))

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出元不确定性决定链式思维(CoT)的效果:当模型对自身证据的可靠性高度不确定时,更多推理会降低准确率。通过自由能最小化策略证明,在重尾精度先验下,有限数量的高有效性线索后停止整合,与“取最优”启发式等价。实验验证了高元不确定性下长CoT导致准确率下降17.3个百分点。

Comments 64 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07720 2026-06-09 cs.AI cs.CL cs.LG 新提交 88%

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆

Mujtaba Farhan, Maheep Chaudhary

机构 * University of Cambridge(剑桥大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11634 2026-06-11 cs.AI 新提交 88%

Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力

Kai Liu, Peijie Dong, Xinchen Xie, Jianfei Gao, Qipeng Guo, Xiaowen Chu, Shaoting Zhang, Kai Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Shanghai AI Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

AI总结 提出SWARR方法,通过监督微调将预训练自注意力模型高效转换为滑动窗口注意力,并利用强化学习策略适应,缩小了与自注意力的性能差距,同时保持线性复杂度的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12331 2026-08-14 cs.CL cs.AI 新提交 88%

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Soochow University(苏州大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31048 2026-07-01 cs.LG cs.AI 新提交 88%

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

从大型推理模型到紧凑学生模型的知识蒸馏:以约翰·O·布莱恩数学竞赛为例

Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

机构 * Northern Kentucky University(北肯塔基大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究从大型推理模型DeepSeek-R1向紧凑学生模型Qwen2.5-7B的知识蒸馏,通过构建思维链训练语料库微调,使学生在竞赛数据集上准确率提升4.76个百分点,并发现响应长度对数学推理质量至关重要。

Comments 15 pages, 3 figures, 7 tables. Code and data available at https://github.com/TempGaurab/Distillation.John-O-Bryan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26102 2026-07-30 cs.CR cs.AI 新提交 87%

A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

检测大语言模型中沉默推理失败的无参考分数

Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.AI

AI总结 该研究针对大语言模型数学思维链评估的推理-答案一致性差距问题,提出无参考的RAFS分数,结合多维度指标诊断沉默推理与答案提取错误,相关研究在GSM8K、MATH数据集上开展验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21704 2026-06-23 cs.CL 新提交 87%

When Compression Helps and When It Hurts: Condition-Aware Analysis of Chain-of-Thought Distillation

何时压缩有益,何时有害:链式思维蒸馏的条件感知分析

Siyang Lyu, Zhijing Sun, Xinghao Chen, Tong Liu, Dawei Zhu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工高等研究院,宁波) Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) The Hong Kong Polytechnic University(香港理工大学) LMU Munich(慕尼黑大学) Saarland University(萨尔大学)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 通过系统实验揭示链式思维蒸馏中压缩方法的关键因素:重要性准则的粒度、重构级别和压缩预算在不同领域和模式下的影响,并给出条件感知的部署指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19257 2026-06-18 cs.CL 新提交 87%

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

DreamReasoner-8B:面向扩散推理模型的块大小课程学习

Zirui Wu, Lin Zheng, Jiacheng Ye, Shansan Gong, Xueliang Zhao, Yansong Feng, Wei Bi, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出块大小课程学习,通过从细粒度到粗粒度的渐进训练,解决块扩散语言模型在长链推理中性能差距问题,DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09585 2026-06-09 cs.AI 新提交 87%

Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

光学推理:重新思考图像作为超越文本的表达性推理媒介

Yutong Bian, Dongjie Cheng, Heming Xia, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05802 2026-08-07 cs.CL cs.LG 新提交 87%

On-Policy Delta Distillation for Multilingual Math Reasoning

面向多语言数学推理的在线策略增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.LG

AI总结 本研究针对多语言数学推理任务,提出OPD²方法,实验表明其在韩语、日语上性能提升显著,且能缩小英语与韩语的性能差距,凸显多语言数据的重要性。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15388 2026-07-20 cs.AI 新提交 86%

Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning

精确但未耦合:评审者的精确性并不能保证在多智能体数学推理中采纳批评意见

Chih-Hsuan Yang, Jingyan Jiang, Vikram Vasudevan, Cheng-Hau Yang, Huihuo Zheng, Le Chen, Eliu A. Huerta, Venkatram Vishwanath, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(title);math reasoning(title);verifier(abstract);分类 cs.AI

AI总结 研究多智能体数学推理中评审者精确性与采纳批评意见的关系,通过对4181个问题测试发现,仅评审者精确性无法解释结果,广播式讨论有时效果更好,还探究了不同干预对结果的影响,指出以评审者为中心的评估可能高估系统质量。

Comments 48 pages, 20 figures, 25 tables. Public release website: https://huggingface.co/spaces/AgentsSci/scientific-agent-protocol-traces-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06447 2026-07-09 cs.AI cs.CL cs.MA 新提交 86%

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

Danus:利用事实图内存编排数学推理智能体

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) School of Mathematics, Tianjin University(天津大学数学学院) Zhongguancun Academy(中关村科学院) Department of Mathematics, Stanford University(斯坦福大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09410 2026-06-09 cs.AI cs.CL 新提交 86%

Capacity, Not Format: Rethinking Structured Reasoning Failures

容量而非格式:重新思考结构化推理失败

Hengxin Fan

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现结构化格式对模型性能的影响取决于其空闲容量,容量不足时通过截断和纯容量竞争两种机制导致性能下降,建议先思考后格式化。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19358 2026-07-23 cs.AI 新提交 85%

LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning

LISA:用于高效长上下文推理的线性索引稀疏注意力

Yu Zhao, Zekun Zhang, Fan Jiang, Bo Zeng, Linlong Xu, Shimin Shan, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对长思维链推理模型中标准自注意力计算复杂度高的问题,提出LISA模块,它集成线性注意力模块和闪电索引器,经两阶段训练,能降低推理复杂度,在特定模型上实现推理加速并提升性能。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15736 2026-07-20 cs.CL 新提交 85%

Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning

更好的开始,更好的结束:用于压缩推理的自引导迭代自推理蒸馏

Leichao Dong, Dongxu Zhang, Yiding Sun, Qirui Wang, Yuhan Wang, Lin Chen, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究大型推理模型冗余计算问题,提出BIRD两阶段自推理蒸馏方法,先在简洁指令下采样简洁解并学习,再用简洁自教师进行策略内蒸馏,在Qwen3系列模型上提升精度并降低响应长度,凸显前缀支持对高效推理蒸馏的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13248 2026-07-16 cs.CL 新提交 85%

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

机构 * Southeast University(东南大学) Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01571 2026-07-03 cs.LG 新提交 85%

Geometric Signatures of Reasoning: A Spectral Perspective on Task Hardness

推理的几何特征:任务难度的谱视角

Aria Masoomi, Mahsa Bazzaz, Adel Javanmard, Vahab Mirrokni

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Google Research(谷歌研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 通过分析Transformer隐藏状态空间中思维链轨迹的谱、位置和运动学几何特征,提出有效维度d_ρ衡量轨迹复杂度,发现平坦特征谱对应更难任务,并利用运动学特征在生成早期预测答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11164 2026-06-10 cs.AI 新提交 85%

ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

ReasonAlloc: 推理模型的分层解码时KV缓存预算分配

Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Shenzhen University of Advanced Technology(深圳理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30852 2026-07-07 cs.AI cs.CL cs.LG 新提交 85%

When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models

何时学习停止有帮助?推理模型中早期退出的成本感知研究

Zhe Dong, Fang Qin, Manish Shah

机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 85%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏