arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2603.21574 2026-03-24 cs.AI 57%

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12275 2026-03-24 cs.CL 57%

On-Policy Context Distillation for Language Models

在线策略上下文蒸馏用于语言模型

Tianzhu Ye, Li Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 57%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16417 2026-03-18 cs.AI 57%

Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences

通过否定来实现AI对齐:为什么否定约束在结构上优于积极偏好

Quan Cheng

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了通过否定约束而非积极偏好进行AI对齐的结构优势,提出基于波普尔的证伪逻辑,指出否定信号方法在避免趋炎附势和提升效果上的有效性。

Comments 9 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15723 2026-03-18 cs.AI 57%

Context-Length Robustness in Question Answering Models: A Comparative Empirical Study

问答模型中的上下文长度鲁棒性:一项比较实证研究

Trishita Dhara, Siddhesh Sheth

机构 * Upper Hand Ace Rent a Car

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过SQuAD和HotpotQA基准评估问答模型在上下文长度变化下的鲁棒性,发现多跳推理任务比单跨度提取任务更易受上下文稀释影响。

Comments Accepted for Oral Presentation at Math AI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15617 2026-03-17 cs.LG 57%

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15351 2026-03-17 cs.AI cs.MA 57%

PMAx: An Agentic Framework for AI-Driven Process Mining

PMAx:一种用于AI驱动流程挖掘的代理框架

Anton Antonov, Humam Kourani, Alessandro Berti, Gyunam Park, Wil M. P. van der Aalst

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) RWTH Aachen University(亚琛工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PMAx通过隐私保护的多代理架构,使非技术人员能将业务问题转化为可靠流程洞察,避免LLM的确定性推理和隐私泄露问题。

Comments Submitted to EMMSAD 2026 (tool demonstration track), under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15340 2026-03-17 cs.CL stat.ML 57%

DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models

DOS:基于依赖关系的掩码扩散语言模型采样器

Xueyu Zhou, Yangrong Hu, Jian Huang

机构 * Department of Data Science and AI(数据科学与人工智能系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13134 2026-03-16 cs.AI 57%

When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO

当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO

Yu Li, Tian Lan, Zhengling Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI 57%

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08068 2026-03-10 cs.AI 57%

In-Context Reinforcement Learning for Tool Use in Large Language Models

上下文强化学习用于大型语言模型中的工具使用

Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Salesforce AI Research(Salesforce AI研究) University of California Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07972 2026-03-10 cs.AI 57%

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

适应性协作与人类:多智能体大语言模型的元认知策略优化与持续学习

Wei Yang, Defu Cao, Jiacheng Pang, Muyan Weng, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 HILA框架通过元认知策略优化与持续学习,实现多智能体与人类的协同协作,提升复杂任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09669 2026-03-05 cs.CL 57%

Query-Level Uncertainty in Large Language Models

查询级不确定性在大语言模型中

Lihu Chen, Gerard de Melo, Fabian M. Suchanek, Gaël Varoquaux

机构 * Imperial College London(伦敦帝国学院) Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20729 2026-03-03 cs.AI physics.comp-ph 57%

Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision

Re4: 具有重写、推理、审查和修订的科学计算代理

Ao Cheng, Lei Zhang, Guowei He

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Re4提出一种基于重写、推理、审查和修订机制的科学计算代理,通过协作框架提升代码生成的可靠性与准确性。

Comments 31 pages, 31 figures, Presented at the ICLR 2026 Workshop on AI and Partial Differential Equations (AI&PDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26144 2026-03-03 cs.AI 57%

The FM Agent

FM代理

Annan Li, Chufan Wu, Zengle Ge, Yee Hin Chong, Zhinan Hou, Lizhe Cao, Cheng Ju, Jianmin Wu, Huaiming Li, Haobo Zhang, Shenghao Feng, Mo Zhao, Fengzhi Qiu, Rui Yang, Mengmeng Zhang, Wenyi Zhu, Yingying Sun, Quan Sun, Shunhao Yan, Danyu Liu, Dawei Yin, Dou Shen

机构 * Baidu AI Cloud(百度AI云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 FM代理是一种利用LLM推理和进化搜索的通用多代理框架,能够自主解决复杂问题并达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07634 2026-03-03 cs.CL 57%

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

FrugalRAG: 在多跳问答中少即是多

Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research India(微软印度研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12664 2026-03-03 cs.AI cs.SY eess.SY 57%

Behavioral Generative Agents for Energy Operations

行为生成代理在能源运营中的应用

Cong Chen, Omer Karaduman, Xu Kuang

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) Graduate School of Business, Stanford University(斯坦福大学商学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23320 2026-03-02 cs.LG cs.MA 57%

ParamMem: Augmenting Language Agents with Parametric Reflective Memory

ParamMem: 通过参数化反思记忆增强语言代理

Tianjun Yao, Yongqiang Chen, Yujia Zheng, Pan Li, Zhiqiang Shen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 ParamMem通过参数化记忆模块提升语言代理的反思多样性,实现更高效的推理和跨任务迁移能力。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21306 2026-02-27 cs.CL 57%

PARL: Prompt-based Agents for Reinforcement Learning

PARL:基于提示的强化学习智能体

Yarik Menchaca Resendiz, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21371 2026-02-26 cs.LG 57%

Interleaved Head Attention

交错头部注意力

Sai Surya Duvvuri, Chanakya Ekbote, Rachit Bansal, Rishabh Tiwari, Devvrit Khatri, David Brandfonbrener, Paul Liang, Inderjit Dhillon, Manzil Zaheer

机构 * Meta UT Austin(德克萨斯大学) UC Berkeley(伯克利大学) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 交错头部注意力通过构造伪头实现跨头混合,提升多步推理效率,在多项式任务和顺序敏感任务中参数效率提高,实测在RULER和OpenThoughts上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20770 2026-02-25 cs.AI 57%

Pipeline for Verifying LLM-Generated Mathematical Solutions

验证大语言模型生成数学解的管道

Varvara Sazonova, Dmitri Shmelkin, Stanislav Kikot, Vasily Motolygin

机构 * Moscow State University(莫斯科国立大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种验证大语言模型数学解的管道,通过提示生成特定形式的解以提高验证准确性,并提供开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15148 2026-02-25 cs.CL 57%

ATTS: Asynchronous Test-Time Scaling via Conformal Prediction

ATTS: 通过置信预测实现异步测试时间扩展

Jing Xiong, Qiujiang Chen, Fanghua Ye, Zhongwei Wan, Chuanyang Zheng, Chenyang Zhao, Hui Shen, Hanbo Li, Chaofan Tao, Haochen Tan, Haoli Bai, Lifeng Shang, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd(华为技术有限公司) University College London(伦敦大学学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 ATTS通过异步测试时间扩展方法,在保持精度的同时实现测试时间扩展的显著加速和吞吐量提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03817 2026-02-24 cs.LG stat.ML 57%

TROLL: Trust Regions improve Reinforcement Learning for Large Language Models

TROLL:通过信任区域改进大型语言模型的强化学习

Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto, Gerhard Neumann

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 TROLL通过引入基于信任区域的离散可微投影,改进了大型语言模型的强化学习训练,提升了训练速度、稳定性和最终成功率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07543 2026-02-24 cs.CV cs.CL 57%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19357 2026-02-24 cs.CV cs.LG 57%

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

MentalBlackboard: 通过数学变换评估空间可视化能力

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :planning(abstract);分类 cs.LG

AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18700 2026-02-24 cs.CR cs.CL 57%

Watermarking LLM Agent Trajectories

对LLM代理轨迹进行水印标记

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University, China(浙江大学) University of Virginia, USA(弗吉尼亚大学) Alibaba Qwen, China(阿里巴巴通义实验室) University of Alberta, Canada(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16554 2026-02-19 cs.LO cs.AI cs.ET quant-ph 57%

MerLean: An Agentic Framework for Autoformalization in Quantum Computation

MerLean:一个用于量子计算自动形式化的代理框架

Yuanjie Ren, Jinzheng Li, Yidi Qi

机构 * Massachusetts Institute of Technology(麻省理工学院) Northeastern University(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MerLean通过自动化形式化框架将量子计算论文中的数学语句转化为Lean代码并回译为可读格式,实现端到端验证,为同行评审和合成数据训练提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16066 2026-02-19 cs.AI 57%

Improving Interactive In-Context Learning from Natural Language Feedback

通过自然语言反馈提升交互式上下文学习

Martin Klissarov, Jonathan Cook, Diego Antognini, Hao Sun, Jingling Li, Natasha Jaques, Claudiu Musat, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14468 2026-02-17 cs.LG 57%

LACONIC: Length-Aware Constrained Reinforcement Learning for LLM

LACONIC:面向LLM的长度感知约束强化学习

Chang Liu, Yiran Zhao, Lawrence Liu, Yaoqi Ye, Csaba Szepesvári, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究院) National University of Singapore(新加坡国立大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13103 2026-02-17 cs.LG 57%

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

R-Diverse: 缓解自博弈LLM训练中的多样性幻觉

Gengsheng Li, Jinghan He, Shijie Wang, Dan Zhang, Ruiqi Liu, Renrui Zhang, Zijun Yao, Junfeng Fang, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏