arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44719 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2605.10805 2026-05-12 cs.AI cs.CL stat.ML 81%

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

推理并非免费:面向LLM-as-a-Judge的鲁棒自适应成本高效路由

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai

机构 * Department of Statistics, University of California, Irvine, USA(加州大学伊维特分校统计学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比推理与非推理法官,发现推理在结构验证任务中提升准确性,但成本高。提出RACER方法,通过分布鲁棒优化动态选择推理或非推理法官,实现成本效率的最优平衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01698 2026-05-12 cs.CL cs.LG 81%

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

训练后探索恢复:大型推理模型的潜在探索解码

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) University of Pisa, Italy(比萨大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。

Comments Project Page: https://github.com/AlbertTan404/LED

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09496 2026-05-12 cs.CL cs.LG 81%

Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models

超越语言:大型语言模型中的格式无关推理子空间

Aojie Yuan, Zhiyuan Su

机构 * University of Southern California(南加州大学) Duke University(杜克大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型中存在格式无关推理子空间(FARS),通过TriForm基准测试发现,FARS能增强概念结构并抑制形式信息,且在不同架构中表现一致,支持柏拉图表示假设。

Comments Preprint. 13 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL 81%

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04078 2026-05-12 cs.LG cs.AI 81%

Validity-Calibrated Reasoning Distillation

有效性校准的推理蒸馏

Khouloud Saadi, Di Wang

机构 * Department of Computer Science(计算机科学系) KAUST(科威特大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出有效性校准的推理蒸馏框架,通过动态监督机制优化学习信号分配,提升数学推理、代码生成和指令遵循任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08221 2026-05-12 cs.LG cs.AI 81%

NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning

NoisyCoconut:通过潜在空间推理实现反事实共识

Michael Jerge, David Evans

机构 * University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 NoisyCoconut通过在潜在空间中注入可控噪声生成多样化推理路径,利用路径一致性的置信度信号提升大语言模型可靠性,无需重新训练即可在多个推理基准中实现有效的覆盖-准确率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 81%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 81%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06188 2026-05-08 cs.AI cs.CL 81%

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

OPSD 压缩 RLVR 教授的内容:一种为推理模型设计的后 RL 压缩阶段

Jaehoon Kim, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OPSD 在数学推理中作为压缩机制更可靠,通过仅训练正确轨迹可保持准确性并显著缩短响应,而训练错误轨迹则损害准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 81%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG 81%

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11504 2026-04-28 cs.LG cs.CL 81%

LongFlow: Efficient KV Cache Compression for Reasoning Models

LongFlow:用于推理模型的高效KV缓存压缩

Yi Su, Zhenxu Tian, Dan Qiao, Yuechi Zhou, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University, China(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 LongFlow通过高效的重要性估计指标实现KV缓存压缩,减少内存消耗和带宽压力,提升推理模型的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13262 2026-04-28 cs.AI cs.CL 81%

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

CURE-MED:基于课程的强化学习用于多语言医学推理

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(中东技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CURE-MED框架,通过课程引导的强化学习提升多语言医学推理的逻辑正确性和语言稳定性,实验表明在13种语言上均优于基线模型,实现了高一致性与高正确率。

Comments Accepted at ACL 2026, main conference, oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21935 2026-04-27 cs.AI cs.LG 81%

Math Takes Two: A test for emergent mathematical reasoning in communication

数学需要两个:一种评估交流中涌现数学推理的测试

Michael Cooper, Samuel Cooper

机构 * Cooper Cognitive(Cooper认知)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Math Takes Two基准测试,通过两个无先验数学知识的智能体交流,评估模型在视觉任务中通过发现潜在结构来发展抽象概念的能力。

Comments Accepted at HCAIR workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20659 2026-04-23 cs.LG cs.AI 81%

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18897 2026-04-22 cs.CL cs.LG 81%

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

少即是多:在大语言模型数学推理中的认知负荷与单提示天花板

Manuel Israel Cazares

机构 * Bytepro AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示工程在形式数学推理中的效果,发现单提示存在性能上限,通过分析发现数学不可判定性、复杂规则系统及提示顺序影响是限制因素,最佳提交在硬性任务中达到79.25%的准确率。

Comments Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI 81%

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12632 2026-04-15 cs.LG cs.AI 81%

Calibration-Aware Policy Optimization for Reasoning LLMs

面向推理大语言模型的校准感知策略优化

Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与复杂系统决策智能国家实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAPO方法,通过引入logistic AUC替代损失和噪声掩码机制,提升推理大语言模型的校准与准确性,实验显示其在多个数学推理基准上校准提升达15%,并在下游任务中进一步提升准确性。

Comments Published as a conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12229 2026-04-15 cs.AI cs.CL 81%

HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models

HintMR:在小型语言模型中激发更强的数学推理

Jawad Hossain, Xiangyu Guo, Jiawei Zhou, Chong Liu

机构 * University at Albany(阿尔巴尼大学) University at Buffalo(布法罗大学) Stony Brook University(石溪大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HintMR框架,通过提示辅助引导小型语言模型进行多步数学问题解决,通过协作的双模型系统提升推理准确性,实验表明在多种数学基准上显著提升性能。

Comments 15 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11188 2026-04-14 cs.CL cs.AI 81%

MathAgent: Adversarial Evolution of Constraint Graphs for Mathematical Reasoning Data Synthesis

MathAgent: 基于约束图的对抗进化用于数学推理数据合成

Zixiong Yu, Jun Rao, Guhan Chen, Songtao Tian, Bohan Li, Jiansheng Wei, Min Zhang, Xiaojun Meng

机构 * Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MathAgent框架,通过约束图的对抗进化生成高质量数学推理数据,提升模型在八个数学基准上的泛化能力。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28204 2026-04-06 cs.LG cs.AI 81%

ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models

ERPO:基于熵调节的策略优化用于大推理模型

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ERPO通过引入熵感知门控、桶式隐式归一化和结果锚定优势合成,解决大语言模型中因统一优势信号导致的探索不足问题,提升推理准确性和路径简洁性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22871 2026-03-25 cs.AI cs.LG math.DS 81%

Dynamical Systems Theory Behind a Hierarchical Reasoning Model

层次推理模型背后的动力系统理论

Vasiliy A. Es'kin, Mikhail E. Smorkalov

机构 * Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系) Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心) Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Contraction Mapping Model,通过将离散递归推理转化为连续的NODEs/NSDEs,提供数学严谨且稳定的推理引擎,在Sudoku-Extreme基准测试中取得93.7%的准确率,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16578 2026-03-18 cs.LG cs.CL 81%

When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective

在何种情况下和为何无监督强化学习在数学推理中成功?一种流形包裹视角

Zelin Zhang, Fei Cheng, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究无监督强化学习在数学推理中的成功条件,提出通过流形包裹视角分析其稳定性与失效原因,设计内在奖励机制并揭示基础逻辑先验对性能的影响。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12284 2026-03-17 cs.AI cs.CL 81%

Shorten After You're Right: Lazy Length Penalties for Reasoning RL

在正确后缩短:用于推理RL的懒惰长度惩罚

Danlong Yuan, Tian Xie, Shaohan Huang, Zhuocheng Gong, Huishuai Zhang, Chong Luo, Furu Wei, Dongyan Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出三种集成到大推理模型强化学习过程中的奖励设计,通过减少响应长度而不增加训练阶段,实验证明在逻辑推理和数学问题中均显著缩短响应长度并保持或提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01214 2026-03-13 cs.CL cs.LG 81%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03752 2026-03-05 cs.CL cs.AI 81%

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

置信度校准的小-大语言模型协作用于成本有效的推理

Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

机构 * Amazon Web Services(亚马逊网络服务) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 COREA通过结合小型和大型语言模型,利用置信度校准提升推理效率,降低21.5%-16.8%成本,同时保持高准确率。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10625 2026-03-05 cs.AI cs.CL 81%

To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks

思考还是不思考,这是大型推理模型在心智理论任务中的问题

Nanxu Gong, Haotian Li, Sixun Dong, Jianxun Lian, Yanjie Fu, Xing Xie

机构 * Arizona State University, Tempe, Arizona, United States(亚利桑那州立大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型推理模型在心智理论任务中的表现,发现其并不总优于非推理模型,且依赖选项匹配而非真实推理,提出干预方法以缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04474 2026-03-03 cs.AI cs.LG 81%

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

DRPO:通过解耦奖励策略优化实现高效推理

Gang Li, Yan Chen, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学) The University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 DRPO通过解耦奖励策略优化,有效解决大型推理模型过度思考问题,实现高效推理并减少响应延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24298 2026-03-03 cs.LG cs.AI 81%

AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

AReaL: 一种用于语言推理的大规模异步强化学习系统

Wei Fu, Jiaxuan Gao, Xujie Shen, Chen Zhu, Zhiyu Mei, Chuyi He, Shusheng Xu, Guo Wei, Jun Mei, Jiashu Wang, Tongkai Yang, Binhang Yuan, Yi Wu

机构 * IIIS, Tsinghua University(清华信息学院) Ant Group(蚂蚁集团) HKUST(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22583 2026-02-27 cs.AI cs.CL 81%

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

数学推理中的策略可执行性:利用人类-模型差异实现有效指导

Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSR框架,通过显式建模策略可执行性,利用人类-模型差异提升数学推理的指导效果。

详情

展开后加载摘要…

URL PDF HTML 收藏