arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2601.04805 2026-06-09 cs.AI 版本更新 85%

Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning

基于思考的非思考:通过强化学习解决混合推理模型训练中的奖励黑客问题

Siyuan Gan, Jiaheng Liu, Boyan Wang, Tianpei Yang, Runqing Miao, Yuyao Zhang, Fanyu Meng, Junlan Feng, Linjian Meng, Jing Huo, Yang Gao

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Jiutian Research, Beijing, China(九天研究院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 针对混合推理模型训练中的奖励黑客问题,提出Thinking-Based Non-Thinking方法,利用思考型回答的解决方案信息为非思考型回答设置差异化最大令牌数,在数学基准上减少约50%令牌使用并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21474 2026-06-02 cs.LG 85%

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation

d2: 通过轨迹似然估计改进扩散语言模型的推理能力

Guanghan Wang, Gilad Turok, Yair Schiff, Marianne Arriola, Volodymyr Kuleshov

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.LG

AI总结 提出d2框架,通过新的策略梯度算法和轨迹似然估计,显著提升扩散语言模型在逻辑与数学推理任务上的性能。

Comments ICML 2026. project page: https://guanghanwang.com/d2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30245 2026-05-29 cs.CL 85%

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

知道在如何解决之前该解决什么:预规划赋能的大语言模型数学推理

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL

AI总结 提出PPC框架,通过引入显式的问题理解阶段(预规划)来弥补现有规划推理方法中“如何解决”与“该解决什么”之间的范式差距,在多个数学推理基准上取得最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06805 2026-05-29 cs.CL 85%

Cognitive Loop of Thought: Reversible Hierarchical Markov Chain for Efficient Mathematical Reasoning

思维认知循环:基于可逆层次马尔可夫链的高效数学推理

Jia-Chen Zhang, Yu-Jie Xiong, Zheng Zhou

机构 * School of Computer Science and Technology, East China Normal University(1 计算机科学与技术学院,华东师范大学) School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(2 电子电气工程学院,上海工程技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出基于可逆层次马尔可夫链的思维认知循环框架,通过层次分解和反向验证机制减少冗余、增强推理鲁棒性,在数学推理任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10195 2026-05-15 cs.LG 85%

Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration

突破奖励障碍:通过投机探索加速树状思维推理

Shuzhang Zhong, Haochen Huang, Shengxuan Qiu, Pengfei Zuo, Runsheng Wang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University School of Integrated Circuits, Peking University(人工智能研究院,北京大学集成电路学院,北京大学) School of Integrated Circuits, Peking University(集成电路学院,北京大学) ByteDance Seed(字节跳动种子)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出SPEX方法,通过投机路径选择、预算分配和自适应终止技术,提升树状思维推理效率,实现1.2至3倍的加速,并与token级投机解码协同提升性能。

Comments OSDI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11625 2026-05-13 cs.AI 85%

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

好折叠还是英雄召唤:学习适应性推理的预算高效思考

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出Budget-Efficient Thinking框架,通过结合行为冷启动与GRPO,在投资成本意识奖励下,学习短回答、早放弃和保留计算资源三种行为,提升推理效率与性能。

Comments 24 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV 85%

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09150 2026-04-13 cs.CL 85%

Think Less, Know More: State-Aware Reasoning Compression with Knowledge Guidance for Efficient Reasoning

少思多知:基于知识引导的状态感知推理压缩以实现高效推理

Yi Sui, Chaozhuo Li, Dawei Song

机构 * Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Open University(开放大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出STACK框架,通过建模阶段特定冗余源并整合检索增强指导,实现逐步推理压缩,减少冗余验证,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08865 2026-04-13 cs.AI 85%

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

SPPO:用于长时间 horizon 推理任务的序列级 PPO

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) INFLY TECH Beijing University of Posts and Telecommunications(北京邮电大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06628 2026-04-09 cs.AI 85%

Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability

重新思考推理SFT中的泛化:对优化、数据和模型能力的条件分析

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究推理SFT的泛化问题,发现泛化受优化动态、训练数据和模型能力共同影响,指出短训练检查点可能低估泛化能力,数据质量和结构及模型能力均影响泛化效果,且推理提升与安全下降存在不对称性。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06268 2026-04-09 cs.LG 85%

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02819 2026-04-06 cs.CL 85%

Student-in-the-Loop Chain-of-Thought Distillation via Generation-Time Selection

通过生成时间选择的学生在环链式思维蒸馏

Chaoqun He, Yingfa Chen, Chaojun Xiao, Xu Han, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出Gen-SSD框架,通过生成时间选择提升链式思维蒸馏效果,实验显示其在数学推理基准上优于传统知识蒸馏和其他基线方法。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13170 2026-03-24 cs.CL 85%

Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism

戴上思考帽子:从人类推理机制视角对链式思考微调的综述

Xiaoshu Chen, Sihang Zhou, Ke Liang, Duanyang Yuan, Haoyuan Chen, Xiaoyu Sun, Lingyuan Meng, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL

AI总结 本文从人类推理机制角度综述了链式思考微调,分析其通过六顶思考帽子框架分类方法,并探讨未来研究方向及现有数据集与模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05592 2026-03-10 cs.CL 85%

MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy

MathSmith: 通过强化策略生成合成问题以实现极难的数学推理

Shaoxiong Zhan, Yanlin Lai, Ziyu Lu, Dahua Lin, Ziqing Yang, Fei Tan

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathSmith通过生成合成问题提升LLM的数学推理能力,采用强化学习优化问题难度和推理复杂性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20187 2026-03-03 cs.CL 85%

Diversity-Enhanced Reasoning for Subjective Questions

增强多样性推理以应对主观问题

Yumeng Wang, Zhiyuan Fan, Jiayu Liu, Jen-tse Huang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本文提出MultiRole-R1框架,通过引入视角多样性和token级多样性提升主观推理性能,实验显示其在主观任务和高级数学推理中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10632 2026-02-12 cs.SC cs.AI 85%

The Neurosymbolic Frontier of Nonuniform Ellipticity: Formalizing Sharp Schauder Theory via Topos-Theoretic Reasoning Models

非均匀椭圆性神经符号前沿:通过拓扑学推理模型形式化精确Schauder理论

Suyash Mishra

机构 * Suyash Mishra

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过拓扑学推理模型形式化精确Schauder理论,结合神经符号大推理模型解决非均匀椭圆正则性理论中的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08688 2026-02-11 cs.AI cs.CV 85%

STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision

STELAR-VISION:基于拓扑意识的高效学习以实现对齐推理

Chen Li, Han Zhang, Zhantao Yang, Fangyi Chen, Zihan Wang, Anudeepsekhar Bolimera, Marios Savvides

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 STELAR-VISION通过拓扑意识训练框架提升视觉-语言模型的推理准确性和效率,实现更高效的多模态任务处理。

Comments This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07213 2026-02-10 cs.LG 85%

Adaptive Retrieval helps Reasoning in LLMs -- but mostly if it's not used

自适应检索有助于增强大语言模型的推理能力——但主要是当它不被使用时

Srijan Shakya, Anamaria-Roberta Hartl, Sepp Hochreiter, Korbinian Pöppel

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本研究发现自适应检索在某些情况下反而有助于提升大语言模型的推理能力,表明模型在无需检索时可能表现更佳。

Comments Eurips Workshop on Principles of Generative Modeling (PriGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06600 2026-02-09 cs.CL 85%

Echoes as Anchors: Probabilistic Costs and Attention Refocusing in LLM Reasoning

回声作为锚点:在大语言模型推理中的概率成本与注意力再聚焦

Zhuoyuan Hao, Zhuo Li, Wu Li, Fangming Liu, Min Zhang, Jing Li

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本研究通过回声蒸馏监督微调和回声提示技术,利用大语言模型中自发的回声现象,提升推理准确性与注意力聚焦效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04246 2026-02-05 cs.CL 85%

CoLT: Reasoning with Chain of Latent Tool Calls

CoLT:基于链式潜在工具调用的推理

Fangwei Zhu, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16552 2026-02-04 cs.CL 85%

Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains

静思速思:动态潜在空间压缩LLM推理链

Wenhui Tan, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 CoLaR通过动态潜在空间压缩LLM推理链,实现高效推理与灵活速度调整,提升数学推理任务的准确率和效率。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04291 2026-02-03 cs.CL 85%

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

数学推理中的进化预提示优化

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

机构 * Meta AI Paris France(Meta AI) TAU, INRIA LISN (CNRS \& Univ. Paris-Saclay) Orsay France INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108 Rouen France Meta AI LISN (CNRS \& Univ. Paris-Saclay) INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出进化预提示优化方法,通过优化示例选择提升CoT预提示效果,在数学推理任务中取得显著提升。

Comments Revised and extended version. To appear in ACM Transactions on Evolutionary Learning and Optimization (TELO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03769 2026-01-13 cs.AI 85%

EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation

EntroCoT:通过自适应熵引导分割增强链式思考

Zihang Li, Yuhang Wang, Yikun Zong, Wenhan Yu, Xiaokun Yuan, Runhan Jiang, Zirui Liu, Tong Yang, Arthur Jiang

机构 * Peking University(北京大学) IQuest Research(IQuest研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 EntroCoT通过自适应熵引导分割提升链式思考的推理质量,构建高质量数据集以提高大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21318 2026-01-08 cs.AI 85%

Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations

超越化学问答:利用模块化化学操作评估LLM的化学推理

Hao Li, He Cao, Bin Feng, Yanjun Shao, Xiangru Tang, Zhiyuan Yan, Li Yuan, Yonghong Tian, Yu Li

机构 * Pengcheng Laboratory(鹏城实验室) International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of AI for Science, Peking University(北京大学科学人工智能学院) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。

Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20647 2025-12-25 cs.AI 85%

Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning

推理中继:评估大型语言模型在数学推理中的稳定性与可替换性

Leo Lu, Jonathan Zhang, Sean Chua, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Binghamton University(宾夕法尼亚州立大学布林茅尔分校) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Algoverse

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。

Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12963 2025-12-15 cs.AI 85%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning

MedRule-KG: 一种基于知识图谱的可靠数学和生物医学推理框架

Crystal Su

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 MedRule-KG通过知识图谱框架和轻量验证器,提升科学推理和药物发现的可靠性与准确性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05580 2025-12-08 cs.CL 85%

Structured Reasoning with Tree-of-Thoughts for Bengali Math Word Problems

基于树状思维的结构化推理用于孟加拉语数学应用题

Aurprita Mahmood, Sabrin alam, Neloy kumer Sagor, Md. Abdul Hadi, Md. Sehab Al Islam, Minhajul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Ahsanullah University of Science and Technology(阿沙努尔大学科学与技术学院) Southeast University(东南大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于树状思维的结构化推理方法,用于提升孟加拉语数学应用题的解决效果,通过实验验证ToT在中等至大规模模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03404 2025-11-17 cs.CV cs.AI 85%

Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling

Xinlei Yu, Chengming Xu, Zhangquan Chen, Yudong Zhang, Shilin Lu, Cheng Yang, Jiangning Zhang, Shuicheng Yan, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) DeepWisdom(深智科技)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02690 2025-11-05 cs.LG 85%

Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs

Georgios Tzannetos, Parameswaran Kamalaruban, Adish Singla

机构 * MPI-SWS(马克斯·普朗克所际研究所)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);math reasoning(abstract);分类 cs.LG

Comments NeurIPS'25 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04081 2025-10-07 cs.CL cs.PL 85%

Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning

Honglin Lin, Qizhi Pei, Xin Gao, Zhuoshi Pan, Yu Li, Juntao Li, Conghui He, Lijun Wu

机构 * OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Soochow University(苏州大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏