arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2604.17708 2026-06-03 cs.AI 79%

Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization

协同进化智能体架构与可解释推理用于自动化优化

Jiahao Huang, Peilan Xu, Xiaoya Nan, Wenjian Luo

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出EvoOR-Agent协同进化框架,通过将智能体工作流表示为活动边网络,并利用图介导的路径条件重组、多粒度语义变异和精英种群更新,实现自动化优化中的自适应协调与可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00532 2026-06-02 cs.AI 79%

KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

KACE: 知识自适应上下文工程用于数学推理

Jayant Parashar, Suchendra M. Bhandarkar

机构 * School of Computing, University of Georgia(计算学院,佐治亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出KACE方法,通过难度和领域分层的知识库与分层自一致性,解决数学推理中上下文膨胀问题,在AIME 2025上达到62.2%准确率。

Comments 9 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01914 2026-06-01 cs.LG 79%

Towards Long-Horizon Interpretability: Efficient and Faithful Multi-Token Attribution for Reasoning LLMs

面向长程可解释性:高效且忠实的多Token归因用于推理大语言模型

Wenbo Pan, Zhichao Liu, Xianlong Wang, Haining Yu, Xiaohua Jia

机构 * Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出FlashTrace方法,通过跨跨度聚合和递归归因机制,在长上下文推理中实现高效且忠实的多Token归因,速度提升超130倍。

Comments Accepted as an Oral paper at ICML 2026. Code available at https://github.com/wbopan/flashtrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18760 2026-06-01 cs.AI cs.FL 79%

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

HERMES: 迈向高效且可验证的LLM数学推理

Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

机构 * Department of Computer Science \& Engineering, The Chinese University of Hong Kong Huawei Foundation Model Department

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Hermes框架,通过将非正式推理与Lean形式化验证交替结合,并引入中间形式化检查和记忆模块,在提升推理准确性的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21235 2026-05-29 cs.CL 79%

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO: 一种用于推理语言模型的Lambda风格策略优化

Redacted by arXiv

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LamPO方法,通过成对分解优势函数和置信度加权,改进基于可验证奖励的强化学习在推理语言模型中的信用分配和训练稳定性。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission. Author list and submitter name redacted due to disputed authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10520 2026-05-29 cs.LG 79%

Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models

优先过程而非结果:奖励潜在思维轨迹改善循环语言模型的推理能力

Jonathan Williams, Esin Tureci

机构 * Department of Computer Science, Princeton University, Princeton NJ, U.S.A(普林斯顿大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对循环语言模型(LoopLM)中标准强化学习(如GRPO)仅奖励最终潜在状态导致推理改进失败的问题,提出RLTT框架,通过在整个潜在推理轨迹上分配奖励实现密集的轨迹级信用分配,显著提升数学推理性能并泛化至非数学任务。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28389 2026-05-28 cs.CL 79%

FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning

FABSVer: 更快的训练与更好的自验证用于大语言模型数学推理

Haihui Pan, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang Education Technology(左岳邦教育科技)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出FABSVer方法,通过融合解生成与自验证为单次前向传播,并引入动态参考模型更新(DRMU)突破奖励瓶颈,在三个模型规模上实现更优的自验证与推理性能,训练时间仅为现有方法的51%-71%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28028 2026-05-28 cs.LG 79%

BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses

BPPO: 二元前缀策略优化用于高效GRPO式推理强化学习与简洁响应

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对GRPO更新成本高且易产生冗长推理的问题,提出BPPO方法,通过仅使用最短正确和错误完成作为更新单元并聚焦前缀优化,实现6倍加速并缩短30-50%响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27715 2026-05-28 cs.CL 79%

Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs

超越输入理解:使用有向无环迹图诊断多语言数学推理

Jiaqiao Zhang, Zhoujun Li, Raoyuan Zhao, Jian Lan, Thomas Seidl, Michael A. Hedderich, Hinrich Schütze, Yihong Liu

机构 * Southwest University(西南大学) LMU Munich(慕尼黑莱茵-瓦尔德大学) MCML

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出有向无环迹图(DATG)框架,通过将推理迹映射到与语言无关的数学锚点和依赖关系,诊断多语言数学推理中的语言影响,并设计Loop-Retry和Formula-Retry两种测试时控制方法改善低资源语言性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27712 2026-05-28 cs.AI 79%

Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking

前缀安全贝叶斯信念追踪用于LLM推理可靠性:将校准与排序分离

Zhenghan Song, Yunyi Li, Yulong Liu

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出前缀安全贝叶斯信念追踪(SBBT)框架,通过分离概率质量与排序能力,在长链推理中实现可靠的在线校准与不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27570 2026-05-28 cs.AI 79%

LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation

LaneRoPE: 用于协同并行推理与生成的位置编码

Gabriele Cesa, Thomas Hehn, Aleix Torres-Camps, Àlex Batlle Casellas, Jordi Ros-Giralt, Arash Behboodi, Tribhuvanesh Orekondy

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出LaneRoPE方法,通过序列间注意力掩码和扩展的RoPE位置编码,使多个序列在生成时协同合作,提升数学推理任务在有限生成长度下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21128 2026-05-28 cs.AI 79%

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

RL 压缩,SFT 扩展:推理型大语言模型的比较研究

Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过轨迹级和步骤级分析框架,比较了强化学习(RL)和监督微调(SFT)对数学推理大语言模型推理路径的影响,发现RL压缩错误轨迹并集中推理功能,而SFT扩展正确轨迹并均匀化推理功能。

Comments Accepted at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26849 2026-05-27 cs.CL 79%

Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning

不确定性感知的自适应测试时推理预算分配

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出不确定性感知预算分配(UAB)框架,通过基于每问题不确定性的凹整数优化重新分配固定采样预算,无需额外推理成本,在多个推理基准上提升准确率高达3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 79%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25065 2026-05-26 cs.AI 79%

Rewarding Structural Conformance of Reasoning using Process Mining

使用过程挖掘奖励推理的结构符合性

Yongjae Lee, Taekhyun Park, Sunghyun Sim, Hyerim Bae

机构 * Dept. of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Dept. of Data Science(数据科学系) Changwon National University(昌原国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TACReward奖励模型,利用过程挖掘技术聚合推理步骤的结构偏差,以改进稀疏奖励策略梯度方法在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14958 2026-05-26 cs.CL 79%

MUR: Momentum Uncertainty guided Reasoning for Large Language Models

MUR: 面向大型语言模型的动量不确定性引导推理

Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Luu Anh Tuan, Haiteng Zhao, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(Vin大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动量不确定性引导推理(MUR)方法,通过追踪和聚合逐步不确定性动态分配推理预算,并引入γ控制机制,在不额外训练的情况下减少冗余计算,在多个基准上平均减少45%以上计算量并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22567 2026-05-22 cs.CL 79%

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

LANG: 用于多语言推理的强化学习与语言自适应提示引导

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室) Meituan Inc.(美团公司) NiuTrans Research, Shenyang, China(牛译研所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LANG框架,通过语言条件提示引导非英语推理任务的探索,解决了多语言环境下强化学习在输入语言一致性与推理质量之间的权衡问题,提升了推理性能而不影响语言一致性。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 79%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29735 2026-05-22 cs.AI 79%

Unveiling the Reasoning Process of Large Language Models

揭示大型语言模型的推理过程

Junjie Zhang, Zhen Shen, Xisong Dong, Gang Xiong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析Transformer层中注意力头和层的信息转换,揭示了大型语言模型在数学和符号推理任务中,中间层将token级信息转化为可重用的关联结构的核心机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19358 2026-05-20 cs.CL 79%

Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning

驯服思考者:面向自适应大语言模型推理的条件熵塑造

Shuyu Wei, Jian Sun, Delai Qiu, Yining Wang, Shengping Liu, Jiaen Liang, Ying Fu, Wei Huang, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) Unisound AI Technology Co., Ltd.(Unisound AI科技有限公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出条件熵塑造(CES)框架,通过动态控制token级响应熵,使大语言模型在简单问题上产生简洁解,在复杂问题上促进深入探索,从而平衡响应长度与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL 79%

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17958 2026-05-19 cs.LG cs.PL 79%

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

通过基于一致性的强化学习增强大语言模型的代码推理能力

Zhanyue Qin, Jia Feng, Yibo Lyu, Yun Peng, Dianbo Sui, Cuiyun Gao, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CodeThinker框架,通过一致性驱动的强化学习方法提升大语言模型的代码推理能力,实验表明其在多个基准测试中表现优异,显著提升了代码生成和数学推理任务的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16727 2026-05-19 cs.AI 79%

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA: 为推理自博弈的协同进化LLM种群

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent

机构 * Absolute Zero Reasoner(绝对零理由器) LoRA adapters(LoRA适配器)

专题命中 数学推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 本文提出PopuLoRA,一种基于种群的非对称自博弈框架,用于强化学习中可验证奖励(RLVR)的后训练LLM。通过专门的LoRA适配器在共享冻结基座上进行教师和学生分工,教师提出问题,学生在程序验证器下解决,不同亚种群间的交叉评估取代了限制单智能体自博弈的自我校准。LoRA权重空间进化算子家族作为7B规模种群训练循环的替代步骤,实现了种群的协同进化竞赛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17831 2026-05-19 cs.AI 79%

The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

令牌游戏:通过谜题对决评估语言模型推理能力

Simon Henniger, Gabriel Poesia

机构 * Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文设计了令牌游戏(TTG)评估框架,通过模型自创谜题进行对决,利用Elo评分比较模型能力,验证了10个前沿模型的推理能力,且无需人工参与谜题创作。

Comments Project website: https://token-games.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19069 2026-05-18 cs.AI 79%

Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

问对问题:通过生成的中间步骤提升推理能力

Hengyuan Hu, Tingchen Fu, Minqi Jiang, Alexander H Miller, Yoram Bachrach, Jakob Nicolaus Foerster

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了生成中间步骤对提升LLM推理能力的作用,提出ARQ框架通过生成问题增强推理过程,展示了生成问题的有效性和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15778 2026-05-18 cs.CL 79%

Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR

稳定知识,促进推理:双令牌约束用于RLVR

Jiakang Wang, Runze Liu, Fuzheng Zhang, Xiu Li, Guorui Zhou, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Archer框架,通过双令牌约束在RLVR中平衡优化,提升LLM的推理和知识保持能力,实验显示在数学推理和代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13338 2026-05-15 cs.CR cs.AI 79%

Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击

Shuqiang Wang, Wei Cao, Jiaqi Weng, Jialing Tao, Licheng Pan, Hui Xue, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于分层遗传算法的黑盒攻击方法,通过系统扰动输入问题的逻辑结构,诱导大语言模型产生过度思考,从而引发资源耗尽攻击。

Comments Accepted at ICML 2026. Code available at: https://github.com/EndlessCao/Overthink-HGA

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11636 2026-05-13 cs.AI 79%

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes:具有演变干扰的对抗自博弈用于LLM推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researchers(独立研究者) Xidian University(西安电子科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Seirênes通过对抗自博弈框架将LLM推理中的上下文干扰转化为训练信号,提升推理鲁棒性,在多个数学推理基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 79%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09548 2026-05-12 cs.CL 79%

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

跨语言在线策略自蒸馏用于多语言推理

Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出COPSD方法,通过将高资源语言的推理行为迁移到低资源语言,提升多语言推理能力,实验显示其在17种低资源非洲语言上表现优异,优于GRPO。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏