arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44666 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3205 篇

2401.05384 2024-01-12 math.HO cs.AI 88%

From Good to Great: Improving Math Reasoning with Tool-Augmented Interleaf Prompting

Nuo Chen, Hongguang Li, Baoyuan Wang, Jia Li

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02439 2023-10-05 cs.CL 88%

Novice Learner and Expert Tutor: Evaluating Math Reasoning Abilities of Large Language Models with Misconceptions

Naiming Liu, Shashank Sonkar, Zichao Wang, Simon Woodhead, Richard G. Baraniuk

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14318 2023-02-20 cs.LG cs.PL 88%

Learning Math Reasoning from Self-Sampled Correct and Partially-Correct Solutions

Ansong Ni, Jeevana Priya Inala, Chenglong Wang, Oleksandr Polozov, Christopher Meek, Dragomir Radev, Jianfeng Gao

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.LG

Comments Accepted to ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12331 2026-08-14 cs.CL cs.AI 新提交 88%

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Soochow University(苏州大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10739 2026-08-04 cs.CL cs.AI 版本更新 88%

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31048 2026-07-01 cs.LG cs.AI 新提交 88%

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

从大型推理模型到紧凑学生模型的知识蒸馏:以约翰·O·布莱恩数学竞赛为例

Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

机构 * Northern Kentucky University(北肯塔基大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究从大型推理模型DeepSeek-R1向紧凑学生模型Qwen2.5-7B的知识蒸馏,通过构建思维链训练语料库微调,使学生在竞赛数据集上准确率提升4.76个百分点,并发现响应长度对数学推理质量至关重要。

Comments 15 pages, 3 figures, 7 tables. Code and data available at https://github.com/TempGaurab/Distillation.John-O-Bryan

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21002 2026-07-01 cs.CL cs.AI 版本更新 88%

Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation

提炼精髓:通过序列截断的高效推理蒸馏

Wei-Rui Chen, Vignesh Kothapalli, Ata Fatahibaarzi, Hejian Sang, Shao Tang, Qingquan Song, Zhipeng Wang, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) LinkedIn(领英)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出通过截断训练序列(仅保留前50%的token)进行知识蒸馏,在数学基准上保留约91%性能,同时减少约50%的训练时间、内存和FLOPs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22139 2026-05-29 cs.CL cs.AI 88%

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

边推理边提问:将推理型大语言模型从被动求解者转变为主动询问者

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Texas, Dallas(德克萨斯大学达拉斯分校) University of Minnesota(明尼苏达大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出主动交互推理(PIR)范式,通过不确定性感知微调和用户模拟器策略优化,使LLM在推理中主动提问以澄清前提和意图不确定性,在数学推理、代码生成和文档编辑任务上显著提升准确率、通过率和BLEU值,同时减少近半推理计算和不必要交互。

Comments ACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07501 2026-05-19 cs.LG cs.CL 88%

ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression

ExpThink:基于经验的强化学习用于自适应思路链压缩

Tingcheng Bian, Yuzhe Zhang, Jing Jin, Jinchang Luo, MingQuan Cheng, Haiwei Wang, Wenyuan Jiang, Miaohui Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学) D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。

Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27462 2026-04-21 cs.CL cs.AI 88%

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision

VCORE: 基于方差控制的优化重加权用于链式推理监督

Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14264 2026-04-15 cs.LG cs.CL 88%

AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin

AAPO: 通过优势边际增强大语言模型的推理能力

Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Frontier Research Department, Baidu Inc.(百度公司前沿研究部)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 AAPO通过引入基于边际的估计方案优化交叉熵损失,有效解决传统分组相对优势估计方法的训练效率问题,在数学推理基准上表现出色。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01367 2026-03-03 cs.AI cs.CL 88%

Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort

这是思考还是作弊?通过测量推理努力来检测隐式奖励黑客

Xinpeng Wang, Nitish Joshi, Barbara Plank, Rico Angell, He He

机构 * LMU Munich(慕尼黑莱茵河大学) New York University(纽约大学) MCML

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 TRACE通过测量推理努力检测隐式奖励黑客,通过截断推理链并评估预期奖励来识别模型利用漏洞的行为,提升数学和编码任务的监控效果。

Comments ICLR 2026 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11824 2026-02-18 cs.LG cs.AI 88%

Latent Veracity Inference for Identifying Errors in Stepwise Reasoning

潜在真实性推断用于识别逐步推理中的错误

Minsu Kim, Jean-Pierre Falet, Oliver E. Richardson, Xiaoyin Chen, Moksh Jain, Sungjin Ahn, Sungsoo Ahn, Yoshua Bengio

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) KAIST(韩国科学技术院) Université de Montréal(蒙特利尔大学) LawZero(法零)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

AI总结 本文提出通过引入潜在真实性变量和Veracity Search算法,提升语言模型在逐步推理中的准确性和可信度,并通过Amortized Veracity Inference实现零样本真实性推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06108 2025-12-02 cs.LG cs.CL 88%

Influence Functions for Efficient Data Selection in Reasoning

用于推理中高效数据选择的影响函数

Prateek Humane, Paolo Cudrano, Daniel Z. Kaplan, Matteo Matteucci, Supriyo Chakraborty, Irina Rish

机构 * Mila, Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Politecnico di Milano(米兰理工学院) Sage Group(Sage集团) Capital One

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 本文提出通过影响函数定义推理数据质量,并引入基于影响的修剪方法,以提升数学推理性能。

Comments 4 pages, 2 figures; added link to codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15965 2025-10-21 cs.LG cs.AI cs.CR 88%

One Token Embedding Is Enough to Deadlock Your Large Reasoning Model

Mohan Zhang, Yihua Zhang, Jinghan Jia, Zhangyang Wang, Sijia Liu, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12759 2025-07-18 cs.CL cs.AI 88%

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程系密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17635 2025-03-07 cs.AI cs.CL 88%

Markov Chain of Thought for Efficient Mathematical Reasoning

Wen Yang, Minpeng Liao, Kai Fan

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

Comments Camera ready version for NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL 88%

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14716 2026-01-22 cs.LG cs.AI cs.CL 88%

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5:通过离线强化学习推进数学推理

Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 PCL-Reasoner-V1.5通过离线强化学习方法,在数学推理任务中达到新高度,实现90.9%和85.6%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06453 2025-02-14 cs.LG cs.AI cs.CL 88%

MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations

Kaixuan Huang, Jiacheng Guo, Zihao Li, Xiang Ji, Jiawei Ge, Wenzhe Li, Yingqing Guo, Tianle Cai, Hui Yuan, Runzhe Wang, Yue Wu, Ming Yin, Shange Tang, Yangsibo Huang, Chi Jin, Xinyun Chen, Chiyuan Zhang, Mengdi Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments v2: fix bugs in Fig. 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07157 2026-08-05 cs.AI 版本更新 87%

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

快速思考:估计前沿AI模型的无思维链任务完成时间范围

Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry Mayne, Simeon Hellsten, Shubhorup Biswas, Ariana Azarbal, William L. Anderson, Elle Najt, Ryan Greenblatt, Julian Stastny

机构 * Redwood Research(红木研究) Astra Fellows Program(Astra 后援计划) Aether Research(Aether 研究) MATS Research(MATS 研究) Polytechnic University of Catalonia(加泰罗尼亚理工大学) Imperial College London(伦敦帝国理工学院) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Durham University(杜伦大学) MIT(麻省理工学院) University of Oxford(牛津大学) University of Glasgow(格拉斯哥大学) Constellation(星座)

专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过超过3万个问题测试前沿AI模型在无思维链推理下的表现,估计其50%任务完成时间范围,发现该时间每约两年翻一番,GPT-5.5已达3分钟以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26102 2026-07-30 cs.CR cs.AI 新提交 87%

A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

检测大语言模型中沉默推理失败的无参考分数

Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.AI

AI总结 该研究针对大语言模型数学思维链评估的推理-答案一致性差距问题,提出无参考的RAFS分数,结合多维度指标诊断沉默推理与答案提取错误,相关研究在GSM8K、MATH数据集上开展验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01348 2026-07-28 cs.CL 版本更新 87%

Procedural Knowledge at Scale Improves Reasoning

大规模程序知识提升推理能力

Di Wu, Devendra Singh Sachan, Wen-tau Yih, Mingda Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Meta FAIR

专题命中 数学推理 :reasoning(title,summary_cn);分类 cs.CL

AI总结 本研究提出Reasoning Memory框架,通过大规模检索增强生成方法,有效利用程序知识提升推理能力,在多个基准测试中表现优于现有方法。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21704 2026-06-23 cs.CL 新提交 87%

When Compression Helps and When It Hurts: Condition-Aware Analysis of Chain-of-Thought Distillation

何时压缩有益,何时有害:链式思维蒸馏的条件感知分析

Siyang Lyu, Zhijing Sun, Xinghao Chen, Tong Liu, Dawei Zhu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工高等研究院,宁波) Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) The Hong Kong Polytechnic University(香港理工大学) LMU Munich(慕尼黑大学) Saarland University(萨尔大学)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 通过系统实验揭示链式思维蒸馏中压缩方法的关键因素:重要性准则的粒度、重构级别和压缩预算在不同领域和模式下的影响,并给出条件感知的部署指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19257 2026-06-18 cs.CL 新提交 87%

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

DreamReasoner-8B:面向扩散推理模型的块大小课程学习

Zirui Wu, Lin Zheng, Jiacheng Ye, Shansan Gong, Xueliang Zhao, Yansong Feng, Wei Bi, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出块大小课程学习,通过从细粒度到粗粒度的渐进训练,解决块扩散语言模型在长链推理中性能差距问题,DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09585 2026-06-09 cs.AI 新提交 87%

Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

光学推理:重新思考图像作为超越文本的表达性推理媒介

Yutong Bian, Dongjie Cheng, Heming Xia, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00206 2026-06-02 cs.LG 87%

Quantized Reasoning Models Think They Need to Think Longer, but They Do Not

量化推理模型认为它们需要思考更长时间,但实际上并不需要

Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

机构 * FAIR at Meta(Meta 联合实验室) Meta AI

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 本文发现后训练量化会降低推理模型准确率并增加思维链长度,通过分析量化模型在中间步骤正确但最终输出错误的“过度思考”错误,提出一种无训练的对过度思考标记施加logit惩罚的方法,在保持或提升准确率的同时减少12-23%的思维链长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24941 2026-05-28 cs.LG 87%

Can Aha Moments Be Fake? Towards Quantifying Decorative and True Thinking in Chain-of-Thought

顿悟时刻可以是假的吗?——量化思维链中的装饰性思考与真实思考

Jiachen Zhao, Yiyou Sun, Weiyan Shi, Dawn Song

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 提出真实思考得分(TTS)量化思维链中每一步对最终答案的因果贡献,发现模型常混合真实思考与装饰性思考,并利用TTS实现有效剪枝与自训练,揭示前沿模型常表述未因果使用的推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25745 2026-05-26 cs.CL 87%

Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains

选择性潜在思考:LLM推理链的自适应压缩

Hui Xie, Jie Liu, Ziyue Qiao, Joaquin Vanschore

机构 * Eindhoven University of Technology(埃因霍温理工大学) School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出选择性潜在思考(SLT)框架,通过置信度门控将冗余推理步骤压缩为潜在表示,关键步骤保留显式思维链,在压缩比相当的情况下准确率比潜在推理基线高22.7%,推理链长度减少58.4%且准确率仅下降2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13165 2026-05-14 cs.CL 87%

STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes

STOP:低数据场景下长形式推理的结构化在线剪枝

Chenjun Xu, Zhennan Zhou, Zhan Su, Bill Howe, Lucy Lu Wang, Bingbing Wen

机构 * University of Washington(华盛顿大学) University of Montreal(蒙特利尔大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 STOP通过结构化在线剪枝减少低数据场景下的长形式推理生成token,同时保持准确性,提升推理效率与结构效率。

Comments 20 pages, 6 figures, 6 tables. Code available at: https://github.com/chenjux/ECN-STOP

详情

展开后加载摘要…

URL PDF HTML 收藏