arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV 73%

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14682 2026-04-17 cs.AI cs.CL 73%

Acceptance Dynamics Across Cognitive Domains in Speculative Decoding

跨认知领域接受动态的推测解码

Saif Mahmoud

机构 * College of Engineering, Al Ain University Abu Dhabi, United Arab Emirates(阿联酋阿因大学工程学院)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于树的推测解码接受动态,分析了不同NLP任务领域对接受概率的影响,发现任务类型比树深度更能预测接受率,且聊天领域表现出较高的熵和接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08527 2026-04-10 cs.CL cs.LG 73%

Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models

解开OPD之谜:大型语言模型中的长度膨胀与稳定策略

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Zicheng Xu, Xiaotian Han, Tianyi Zhang, Vladimir Braverman

机构 * Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿) Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特) Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了OPD训练中长度膨胀问题,提出StableOPD框架结合参考 divergence 约束和rollout混合蒸馏,有效稳定训练并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03703 2026-04-10 cs.LG cs.AI 73%

TreeAdv: Tree-Structured Advantage Redistribution for Group-Based RL

TreeAdv:基于群体的强化学习中的树状优势再分配

Lang Cao, Hui Ruan, Yongqian Li, Peng Chao, Wu Ning, Haonan Song, Renhong Chen, Yitong Li

机构 * Huawei Technologies Co., Ltd., China(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TreeAdv通过引入树状结构显式化群体回放的探索和优势分配,提升群体强化学习在复杂推理任务中的效率与逻辑深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03993 2026-04-07 cs.LG cs.AI 73%

Can LLMs Learn to Reason Robustly under Noisy Supervision?

大语言模型能否在噪声监督下实现稳健推理?

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习中可验证奖励在噪声标签下的鲁棒性问题,提出在线标签细化方法,通过动态修正潜在噪声标签提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01152 2026-04-02 cs.CL cs.AI 73%

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习

Mohammad R. Abu Ayyash

机构 * Brains Build Research

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。

Comments 26 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03638 2026-04-01 cs.LG cs.AI math.RT stat.ML 73%

Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling

隐式模型的表达能力:丰富的均衡与测试时扩展

Jialin Liu, Lisang Ding, Stanley Osher, Wotao Yin

机构 * University of Central Florida(中佛罗里达大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Decision Intelligence Lab, DAMO Academy, Alibaba US(达摩院决策智能实验室,阿里巴巴美国)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 研究隐式模型通过非参数分析揭示其表达能力,证明其表达能力随测试时计算量增加而提升,验证了其在多个领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14751 2026-03-26 cs.LG cs.AI 73%

Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries

超越多令牌预测:通过未来摘要预训练语言模型

Divyat Mahajan, Sachin Goyal, Badr Youbi Idrissi, Mohammad Pezeshki, Ioannis Mitliagkas, David Lopez-Paz, Kartik Ahuja

机构 * Carnegie Mellon University(卡内基梅隆大学) FAIR at Meta(Meta的FAIR)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出未来摘要预测(FSP)方法,通过训练辅助头预测紧凑的长期未来表示,提升长形式生成能力,在数学、推理和编码基准测试中优于NTP和MTP。

Comments Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23414 2026-03-25 cs.LG cs.AI 73%

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练

Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18582 2026-03-10 cs.CL cs.LG 73%

Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control

探索提示调优中嵌入先验以提升可解释性和可控性

Sergey Sedov, Sumanth Bharadwaj Hachalli Karanam, Venu Gopal Kadamba

机构 * New York University(纽约大学)

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示调优中嵌入坍缩现象对模型性能的影响,提出嵌入先验以提升可解释性和可控性,并发现不同激活区域的嵌入能有效提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07835 2026-03-10 cs.CR cs.AI cs.CL 73%

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施

Bo Jiang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08211 2026-03-06 cs.CL cs.AI 73%

Large Language Models are Contrastive Reasoners

大型语言模型是对比推理器

Liang Yao

机构 * Sun Yat-sen University Shenzhen, China(中山大学深圳校区)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对比提示方法,通过简单提示提升大型语言模型的推理能力,在算术和常识推理任务中优于零样本和少样本方法。

Journal ref Expert Systems With Applications 301 (2026) 130407

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 73%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02203 2026-03-03 cs.AI cs.CL 73%

Tool Verification for Test-Time Reinforcement Learning

测试时强化学习的工具验证

Ruotong Liao, Nikolai Röhrich, Xiaohan Wang, Yuhui Zhang, Yasaman Samadzadeh, Volker Tresp, Serena Yeung-Levy

机构 * Ludwig-Maximilians-University of Munich(慕尼黑路德维希-马克西米利安大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 T^3RL通过引入测试时工具验证机制,提升测试时强化学习在复杂问题上的表现,减少错误模式崩溃风险。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01365 2026-03-03 cs.LG cs.AI cs.RO cs.SY eess.SY 73%

Align and Filter: Improving Performance in Asynchronous On-Policy RL

对齐与过滤:提升异步在线强化学习的性能

Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth

机构 * Mila – Quebec AI Institute, Canada(魁北克AI研究所) University of Alberta, Canada(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于总变分的优势对齐约束策略优化方法,用于缓解异步在线强化学习中的策略滞后问题,并在经典和现代强化学习任务中展示了其优越的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10609 2026-03-03 cs.CL cs.AI 73%

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

在线因果卡尔曼滤波用于稳定和有效的策略优化

Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPO方法,通过在线因果卡尔曼滤波稳定和提升策略优化效果,有效解决token级重要性采样比率的高方差问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02555 2026-03-03 cs.LG cs.AI 73%

Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards

通过参数空间噪声学习探索:深入研究可验证奖励的强化学习

Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。

Comments 17 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24110 2026-03-02 cs.AI cs.CL 73%

Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance

回收失败:通过细粒度反策略指导在RLVR中恢复探索

Yanwei Ren, Haotian Zhang, Likang Xiao, Xikai Zhang, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院) University of Leicester, Leicester, United Kingdom(莱斯特大学) Nanyang Technological University, Singapore(南洋理工大学) The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SCOPE通过细粒度反策略指导在RLVR中恢复探索,提高轨迹多样性13.5%,在数学推理和分布外推理任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 73%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 73%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15194 2026-02-19 cs.LG cs.CL 73%

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation

无需标签的进化语言模型:多数驱动选择,新颖性促进变异

Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(圣母大学) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13262 2026-02-17 cs.AI cs.CL 73%

General learned delegation by clones

通过克隆实现通用学习委托

Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。

Comments Code available at https://github.com/SuffixAutomata/SELFCEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08847 2026-02-10 cs.LG cs.AI 73%

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Dr. MAS:多智能体大语言模型系统的稳定强化学习

Lang Feng, Longtao Zheng, Shuo He, Fuxiang Zhang, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Dr. MAS通过智能体级归一化方法稳定多智能体大语言模型的强化学习训练,提升性能并减少梯度不稳定问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00884 2026-02-10 cs.LG cs.CL 73%

Towards Active Synthetic Data Generation for Finetuning Language Models

面向微调语言模型的主动合成数据生成

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. Ash

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过主动学习方法生成合成数据以提升语言模型微调效果,验证了简单筛选标准在数学和逻辑推理任务中的有效性。

Comments 14 figures, 37 pages. Website and code: https://iterative-sd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05890 2026-02-06 cs.LG cs.CL 73%

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04417 2026-02-05 cs.LG cs.AI 73%

EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习

Lunjun Zhang, Jimmy Ba

机构 * University of Toronto(多伦多大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00294 2026-02-04 cs.LG cs.AI 73%

Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models

免费草稿与验证:迈向无损并行解码的扩散大语言模型

Shutong Wu, Jiawei Zhang

机构 * Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI(计算机科学系,威斯康星大学麦迪逊分校,麦迪逊,WI)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FreeDave是一种专为DLLMs设计的快速解码算法,通过无损并行解码实现高效推理,无需模型修改或额外模块,提升了推理速度而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19920 2026-01-29 cs.LG cs.AI 73%

Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning

通过行为校准强化学习缓解大语言模型幻觉

Jiayun Wu, Jiashuo Liu, Zhiyuan Zeng, Tianyang Zhan, Tianle Cai, Wenhao Huang

机构 * Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过行为校准强化学习提升大语言模型的不确定性量化能力,使其在数学推理和事实问答任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04157 2026-01-23 cs.CL cs.LG 73%

FLEx: Language Modeling with Few-shot Language Explanations

FLEx:基于少样本语言解释的语言建模

Adar Avsian, Christopher Richardson, Anirudh Sundar, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 FLEx通过少量解释性示例改进语言模型,有效减少错误并优于链式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06065 2026-01-06 cs.AI cs.CL 73%

ScRPO: From Errors to Insights

ScRPO:从错误到洞察

Lianrui Li, Dakuan Lu, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ScRPO通过自我反思和错误纠正机制,提升大语言模型的数学推理能力,在多个基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏