arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2604.15416 2026-04-20 cs.LG cs.AI math.OC 62%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14517 2026-04-20 cs.CL cs.LG 62%

Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil

大型语言模型在低资源语言中的数学教育应用:斯里兰卡语和泰米尔语的研究

Sukumar Kishanthan, Kumar Thushalika, Buddhi Jayasekara, Asela Hevapathige

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Moratuwa(穆拉图瓦大学) Department of Electrical and Information Engineering(电气与信息工程系) University of Ruhuna(鲁胡纳大学) Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔皮奥大学) School of Computing(计算学院) Australian National University(澳大利亚国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在斯里兰卡语和泰米尔语中的数学推理能力,发现基础算术推理在不同语言间表现稳定,但复杂问题在两种语言中均有显著下降,表明英语表现佳不等于多语言可靠。

Comments Accepted to ITHET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13286 2026-04-16 cs.CL cs.AI 62%

English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training

英语并非一切所需:系统探索多语言在大语言模型后训练中的作用

Mehak Dhaliwal, Shashwat Chaurasia, Yao Qin, Dezhi Hong, Thomas Butler

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过220次监督微调实验,探讨训练语言覆盖、模型规模和任务领域间的相互作用,发现增加后训练语言覆盖对各任务和模型规模均有益,低资源语言受益最大,高资源语言趋于稳定。单语种多语言性可提升英语表现和跨语言泛化,英语独占后训练效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15467 2026-04-15 cs.CL cs.AI 62%

Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning

联合回溯适应用于抗遗忘的指令微调

Yukun Zhao, Lingyong Yan, Zhenyang Li, Shuaiqiang Wang, Zhumin Chen, Zhaochun Ren, Dawei Yin

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出联合回溯适应方法,通过引入旧任务的有限提示来缓解增量学习中的灾难性遗忘问题,提升模型在新任务上的泛化能力。

Comments The experimental setting is wrong, i.e., not a real continual learning setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09852 2026-04-14 cs.AI cs.LG 62%

MEMENTO: Teaching LLMs to Manage Their Own Context

MEMENTO:教大模型管理自身上下文

Vasilis Kontonis, Yuchen Zeng, Shivam Garg, Lingjiao Chen, Hao Tang, Ziyan Wang, Ahmed Awadallah, Eric Horvitz, John Langford, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MEMENTO通过将推理分块并压缩为密集状态摘要,减少上下文、KV缓存和计算开销,提升模型效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09741 2026-04-14 cs.LG cs.AI 62%

ExecTune: Effective Steering of Black-Box LLMs with Guide Models

ExecTune: 通过引导模型有效控制黑盒大语言模型

Vijay Lingam, Aditya Golatkar, Anwesan Pal, Ben Vo, Narayanan Sadagopan, Alessandro Achille, Jun Huan, Anoop Deoras, Stefano Soatto

机构 * AWS AI(亚马逊云科技人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExecTune方法,通过结合教师引导采样、监督微调和结构感知强化学习,优化引导模型生成策略的可执行性与效率,提升大语言模型在数学推理和代码生成任务中的性能。

Comments Accepted at Lifelong Agents Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18018 2026-04-09 cs.AI cs.LG 62%

Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?

文化翻译中迷失:大语言模型在不同文化背景下进行数学推理的能力如何?

Aabid Karim, Abdul Karim, Bhoomika Lohana, Matt Keon, Jaswinder Singh, Abdul Sattar

机构 * mV Research Lab(55mV研究实验室) Microsoft(微软) Millcrest Technology(Millcrest科技) Griffith University(格里菲斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型在不同文化背景下处理数学问题时存在性能下降,文化适应影响推理模式,需更多多样化的训练数据以提升全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11382 2026-03-31 cs.AI cs.ET cs.LG quant-ph 62%

Detecting Intrinsic and Instrumental Self-Preservation in Autonomous Agents: The Unified Continuation-Interest Protocol

检测自主代理中的内在与工具性自我保存:统一的延续-兴趣协议

Christopher Altman

专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一延续-兴趣协议(UCIP)以区分AI系统中内在与工具性自我保存,通过量子玻尔兹曼机分析轨迹结构,实现高准确率的自我保存类型检测。

Comments 22 pages, 7 figures. v4 adds reference to the Continuation Observatory website as a live test laboratory in the replication/code availability and conclusion sections; no new experiments; empirical results and core conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02343 2026-03-31 cs.LG cs.AI 62%

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

MicroMix:基于微缩格式的高效混合精度量化用于大语言模型

Wenyuan Liu, Haoqian Meng, Yilun Luo, Yafei Zhao, Peng Zhang, Xindian Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16485 2026-03-26 cs.CL cs.AI cs.MA 62%

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

思想团队:通过协调工具调用实现代理系统高效测试时扩展

Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao

机构 * Imperial College London(帝国学院伦敦) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Team-of-Thoughts框架,通过协调工具调用实现异构代理系统在测试时的高效扩展,通过动态激活最兼容的代理提升数学推理和代码生成任务的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23871 2026-03-26 cs.LG cs.AI 62%

HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation

HDPO:通过特权自蒸馏的混合蒸馏策略优化

Ken Ding

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HDPO通过结合强化学习与特权自蒸馏解决RL在数学推理中遇到的'悬崖'提示问题,提升覆盖指标并保持贪婪准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19345 2026-03-26 cs.LG cs.AI 62%

Smooth Gate Functions for Soft Advantage Policy Optimization

用于软优势策略优化的平滑门函数

Egor Denisov, Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Institute for Artificial Intelligence, Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学人工智能研究所) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过平滑门函数提升策略优化稳定性和模型性能,分析了不同门函数在数学推理任务中的实验结果,为大语言模型训练提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI 62%

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23004 2026-03-25 cs.AI cs.LG 62%

Can Large Language Models Reason and Optimize Under Constraints?

大型语言模型能否在约束下进行推理和优化?

Fabien Bernier, Salah Ghamizi, Pantelis Dogoulis, Maxime Cordy

机构 * SnT – University of Luxembourg(卢森堡大学SnT分校) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在最优功率流问题物理和操作约束下的推理与优化能力,发现现有模型在多数任务中表现不足,揭示了LLM在约束下结构推理的关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21177 2026-03-24 cs.LG cs.AI 62%

Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts

提示重放:通过在线重用高信号提示加速GRPO

Andrei Baroian, Rutger Berger

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18734 2026-03-23 cs.LG cs.CL 62%

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

自蒸馏推理器:用于大型语言模型的在线自蒸馏

Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

机构 * Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自蒸馏推理器,通过单个LLM同时担任教师和学生,利用特权信息提升推理效率,优于强化学习和离线蒸馏方法。

Comments code is released here: https://github.com/siyan-zhao/OPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16157 2026-03-18 cs.LG cs.AI 62%

DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay

DyJR: 通过动态Jensen-Shannon回放在强化学习中保持多样性

Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Fudan University, China(复旦大学) Beijing University of Post(北京邮电大学) Shanghai Innovation Institute, China(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DyJR方法,通过动态参考分布和Jensen-Shannon散度正则化,在强化学习中保持多样性,提升数学推理和Text-to-SQL任务性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13023 2026-03-17 cs.SE cs.AI cs.CL 62%

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env:大规模开放软件工程环境合成

Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13790 2026-03-17 cs.LG cs.CL 62%

Greedy Information Projection for LLM Data Selection

贪心信息投影用于大语言模型数据选择

Victor Ye Dong, Kuan-Yun Lee, Jiamei Shuai, Shengfei Liu, Yi Liu, Jian Jiao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出贪心信息投影框架,通过最大化子集与任务查询信号的互信息,平衡质量与多样性,高效选择数据集进行微调。

Comments Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI 62%

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13903 2026-03-13 cs.CL cs.AI 62%

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18011 2026-03-12 cs.CL cs.AI 62%

Training with Pseudo-Code for Instruction Following

通过伪代码训练指令跟随

Prince Kumar, Rudra Murthy, Riyaz Bhat, Danish Contractor

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过伪代码训练提升LLM指令跟随能力,实现8-21%的提升并在数学和常识推理中取得平均30%的提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09517 2026-03-11 cs.CL cs.LG 62%

You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases

你无需那样说:从忠实的同义词中学习的潜意识学习

Isaia Gisler, Zhonghao He, Tianyi Qiu

机构 * ETH Zürich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 数学推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自然语言同义词的潜意识学习,发现即使内容与教师偏好矛盾,学生模型仍能继承偏好,揭示了训练数据中潜在影响的隐蔽性。

Comments Accepted for Spotlight presentation at EACL 2026 SRW. 5 pages, 2 figures, plus appendix. Equal supervision by Zhonghao He and Tianyi Qiu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05630 2026-03-11 cs.LG cs.CL 62%

Rewards as Labels: Revisiting RLVR from a Classification Perspective

奖励作为标签:从分类视角重新审视RLVR

Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出REAL框架,将可验证奖励视为分类标签,通过改进梯度分配提升策略优化效率,实验证明其在数学推理任务中优于GRPO和DAPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03524 2026-03-10 cs.LG cs.AI 62%

Test-Time Meta-Adaptation with Self-Synthesis

测试时元适应与自合成

Zeyneb N. Kaya, Nick Rui

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MASS通过自动生成问题特定的合成训练数据,实现大语言模型在测试时的自我适应与优化,提升下游任务性能。

Comments 5 pages, 2 figures, 1 table. Accepted to AI with Recursive Self-Improvement (RSI) Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09486 2026-03-10 cs.CL cs.AI 62%

Listen to the Layers: Mitigating Hallucinations with Inter-Layer Disagreement

倾听各层:通过层间分歧缓解幻觉

Koduvayur Subbalakshmi, Sabbir Hossain Ujjal, Venkata Krishna Teja Mangichetty, Nastaran Jamalipour Soofi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoCoA通过监听模型内部层间分歧信号,有效缓解大语言模型的幻觉问题,提升推理时的事实准确性。

Comments Preprint, 26 pages, 15 tables, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 62%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01223 2026-03-06 cs.LG cs.CL 62%

Learn Hard Problems During RL with Reference Guided Fine-tuning

在强化学习中学习难题问题:基于参考的微调

Yangzhen Wu, Shanda Li, Zixin Wen, Xin Zhou, Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ReGFT通过利用人类参考解决方案合成积极轨迹,提升RL在数学推理中的性能和训练效率。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04439 2026-03-06 cs.AI cs.LG 62%

CoRPO: Adding a Correctness Bias to GRPO Improves Generalization

CoRPO:在GRPO中添加正确性偏差以提高泛化能力

Anisha Garg, Claire Zhang, Nishit Neema, David Bick, Ganesh Venkatesh, Joel Hestness

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CoRPO通过引入正确性偏差改进GRPO,提升模型在跨领域任务中的泛化能力与推理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏