arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2607.22629 2026-07-28 cs.AI cs.CL 新提交 84%

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

掩码蒸馏:将思维链内化到语言模型中

Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13935 2026-07-27 cs.AI cs.LG stat.ML 版本更新 84%

Statistical Early Stopping for Reasoning Models

统计早停法用于推理模型

Yangxinyu Xie, Tao Wang, Soham Mallick, Yan Sun, Georgy Noarov, Mengxin Yu, Tanwi Mallick, Edgar Dobriban

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17993 2026-07-14 cs.LG cs.AI 版本更新 84%

Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers

Turbo Connection: 从高层到低层的信息流推理

Mohan Tang, Sidi Lu

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Turbo Conn通过反向连接增强LLM推理能力,实现任务性能显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13356 2026-07-10 cs.CL cs.AI cs.GT 版本更新 84%

Peer-Predictive Self-Training for Language Model Reasoning

同伴预测自训练用于语言模型推理

Shi Feng, Hanlin Zhang, Fan Nie, Sham Kakade, Yiling Chen

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PST框架,通过多模型协作利用交叉模型聚合响应作为内部训练信号,提升数学推理任务的准确率并减少生成-验证差距。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 84%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18814 2026-07-07 cs.LG cs.AI 版本更新 84%

A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

模型可以自我帮助:无需奖励的自我训练用于大语言模型推理

Mengqi Li, Lei Zhao, Anthony Man-Cho So, Ruoyu Sun, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SePT方法,通过自我生成和训练自我生成响应交替进行,无需外部奖励提升大语言模型推理性能,实验表明在多个数学推理基准上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23181 2026-06-23 cs.AI cs.CL 新提交 84%

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART: 用于混合推理模型中免训练自适应思考预算的草案一致路由

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonseok Moon, Heuiseok Lim

机构 * Korea University(高丽大学) dot(42dot) Konkuk University(建国大学) Yonsei University(延世大学) Soongsil University(崇实大学) Kumoh National Institute of Technology(金乌国立技术学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出免训练路由框架DART,通过采样两个廉价无思考草案,当草案一致时直接回答,不一致时根据草案熵预测思考预算,在保持或提升准确率的同时大幅减少思考令牌使用。

Comments 15 pages, 4 figures, 16 tables. Code: https://github.com/js-lee-AI/DART

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18419 2026-06-15 cs.LG cs.CL stat.ML 版本更新 84%

Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

知道何时退出:LLM推理中动态弃权的原则性框架

Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz, Ram Yazdi, Patrick Rebeschini

机构 * Hebrew University of Jerusalem(特拉维夫大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13125 2026-06-12 cs.LG cs.AI 新提交 84%

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

选择与改进:理解推理后训练的机制

Akshay Krishnamurthy, Audrey Huang, Nived Rajaraman

机构 * Microsoft Research NYC(微软研究院纽约) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25184 2026-06-09 cs.LG cs.AI 版本更新 84%

Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

在移动边缘训练:一种在线验证的提示选择方法用于大型推理模型的高效强化学习训练

Jiahao Wu, Ning Lu, Shengcai Liu, Kun Wang, Yanting Yang, Bailong Lin, Chen Jason Zhang, Li Qing, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学理工大学) Nanyang Technological University(南洋理工大学) Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HIVE方法,通过历史奖励轨迹和实时提示熵实现高效RL训练,提升提示选择效率而不牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07410 2026-06-08 cs.LG cs.AI 新提交 84%

A Comprehensive Anatomy of Human and DeepSeek-R1 LLM Mathematical Reasoning

人类与DeepSeek-R1大语言模型数学推理的全面解剖

Yuxiang Chen, Jun Wang

机构 * UCL Centre for Artificial Intelligence(伦敦大学人工智能中心)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 通过AIME 2025所有30道题目的10247个推理步骤注释,发现DeepSeek-R1存在拓扑模仿(表面模仿推理而非真正推理),但成功轨迹中分支与回溯的稳定使用以及反射在演绎推理中的有效放置是真正推理的信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29190 2026-05-29 cs.LG cs.CL 84%

When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

当RL抑制自身词汇:在谜题到数学迁移中恢复推理多样性

Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski, Fergal Reid

机构 * Fin AI Research(Fin AI研究院) Salk Institute for Biological Studies(萨尔克生物医学研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于可验证奖励的强化学习框架,通过引入新颖性奖励机制恢复被抑制的探索性推理原语,实现从约束满足谜题到数学问题的跨领域迁移,在无需数学数据的情况下将OlymMATH-Hard的pass@32从16%提升至36%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-05-28 cs.CL cs.AI 84%

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23274 2026-05-27 cs.LG cs.AI 84%

Real-Time Progress Prediction in Reasoning Language Models

推理语言模型中的实时进度预测

Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过离散化推理轨迹训练线性探针和微调模型生成0-100%进度估计,实现推理语言模型中的实时进度预测,并在数学推理任务上达到0.161 MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16938 2026-05-19 cs.CL cs.AI q-bio.NC 84%

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐

Yueqing Hu, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学系)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI 84%

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13221 2026-05-14 cs.AI cs.LG 84%

An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing

基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算

Hanwen Zhang, Dusit Niyato, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low

机构 * Nanyang Technological University(南洋理工大学) Singapore Institute of Technology(新加坡理工学院) Seatrium New Energy Laboratory(Seatrium 新能源实验室) Ministry of Education (MOE) Tier 1(教育部 Tier 1) Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09920 2026-05-12 cs.LG cs.AI 84%

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

通过内在梯度-范数奖励实现无需验证器的LLM强化学习

Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09490 2026-05-12 cs.CL cs.AR cs.LG 84%

Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

并非所有思考都需要HBM:面向LLM推理的语义感知内存层次结构

Aojie Yuan, Tianqi Shen, Dajun Zhang

机构 * University of Southern California(南加州大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种语义感知内存层次结构,通过累积注意力评分将token分为四个层级,减少HBM占用并提升推理准确性,实验表明仅3%的淘汰率可保持91%的GSM8K准确率。

Comments Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08625 2026-05-12 cs.LG cs.AI 84%

Reasoning-Aware Training for Time Series Forecasting

面向时间序列预测的推理感知训练

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Chun-Liang Li, Qiang Cheng, Tomas Pfister, Jinsung Yoon

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出STRIDE框架,通过将LLM推理注入到时间序列基础模型的连续嵌入空间中,提升数值预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13010 2026-05-11 cs.LG cs.AI 84%

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Lightning OPD: 为大推理模型高效实现离线在线蒸馏

Yecheng Wu, Song Han, Hai Cai

机构 * NVIDIA

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18857 2026-05-08 cs.AI cs.LG 84%

CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning

CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距

Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21225 2026-04-29 cs.CL cs.AI 84%

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

MGSM-Pro:一种用于多语言数学推理评估的简单策略

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) University of Toronto(多伦多大学) Masakhane Hanyang University(翰阳大学) Instituto Politécnico Nacional(国家理工学院) Umbaji University of Ibadan(伊巴德安大学) McPherson University(麦菲逊大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MGSM-Pro,通过增加数字变化实例提升多语言数学推理评估的鲁棒性,发现低资源语言在不同数字实例下表现下降,且专有模型对数字变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24003 2026-04-28 cs.CL cs.LG 84%

Stabilizing Efficient Reasoning with Step-Level Advantage Selection

通过步骤级优势选择稳定高效推理

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。

Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23213 2026-04-28 cs.CL cs.AI 84%

Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process

评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成

Zhijun Chen, Zeyu Ji, Qianren Mao, Hao Wu, Jinhuan Song, Junhang Cheng, Bangjie Qin, Zhuoran Li, Jingzheng Li, Kai Sun, Zizhe Wang, Yikun Ban, Zhu Sun, Xiangyang Ji, Hailong Sun

机构 * Beihang University, Beijing, China(北京航空航天大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Tsinghua University, Beijing, China(清华大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26771 2026-04-21 cs.CL cs.LG 84%

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models

LogicDiff:逻辑引导去噪提升掩码扩散语言模型的零样本推理

Shaik Aman

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 LogicDiff通过逻辑角色引导去噪策略提升掩码扩散语言模型的零样本推理能力,显著提高GSM8K和MATH-500任务的准确率,但较少样本提示下效果受限。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11274 2026-04-20 cs.AI cs.CL 84%

SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning

SelfBudgeter:面向高效大语言模型推理的自适应令牌分配

Zheng Li, Qingxiu Dong, Jingyuan Ma, Di Zhang, Kai Jia, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) BandAI, Bytedance(字节跳动BandAI)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SelfBudgeter策略,通过自适应预算分配提升LLM推理效率,实验显示在数学推理任务中平均响应长度压缩61%并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03111 2026-04-03 cs.LG cs.CL 84%

One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning

一个样本统治一切:通过强化学习实现多学科推理的极端数据效率

Yiyuan Li, Zhen Huang, Yanan Wu, Weixun Wang, Xuefeng Li, Yijia Luo, Wenbo Su, Bo Zheng, Pengfei Liu

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) GAIR

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多学科学习框架,通过一个训练样本提升多领域推理能力,证明样本质量而非数量对模型性能的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI 84%

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 84%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏