arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45006 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2604.24302 2026-04-28 cs.CL 57%

Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer

可微的忠实对齐用于跨模型电路转移

Shun Shao, Binxu Wang, Shay B. Cohen, Anna Korhonen, Yonatan Belinkov

机构 * University of Cambridge(剑桥大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所) University of Edinburgh(爱丁堡大学) Technion(技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DFA框架,通过学习可微对齐将小模型的电路信息转移到大模型,实验证明在事实检索、多选推理和算术任务中,DFA在Llama-3 1B→3B任务中表现优异,且在某些情况下恢复的电路忠实度不低于直接归因。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04118 2026-04-28 cs.LG stat.ML 57%

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

引导推测推断用于大型语言模型的高效测试时间对齐

Jonathan Geuter, Youssef Mroueh, David Alvarez-Melis

机构 * Harvard SEAS(哈佛大学SEAS学院) Kempner Institute(Kempner研究所) IBM Research(IBM研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。

Comments 41 pages, 11 figures. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21187 2026-04-24 math.CO cs.AI 57%

Doubly Saturated Ramsey Graphs: A Case Study in Computer-Assisted Mathematical Discovery

双重饱和的Ramsey图:计算机辅助数学发现的一个案例研究

Benjamin Przybocki, John Mackey, Marijn J. H. Heule, Bernardo Subercaseaux

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过结合SAT求解与定制生成的代码,发现无限多的双重饱和Ramsey图,回答了Grinstead和Roberts在1982年的疑问,并利用LLM生成形式化证明,展示自动化推理、大语言模型和形式验证在数学发现中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19837 2026-04-23 cs.AI cs.MA 57%

Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organizations

Forage V2:自主代理组织中的知识进化与转移

Huaqing Xie

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Forage V2通过构建学习型组织架构,实现知识积累与跨模型转移,提升自主代理任务的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02989 2026-04-23 cs.CL 57%

Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy

通过系统2策略解析大语言模型中大规模计数的机制

Hosein Hasani, Mohammadali Banayeeanzade, Ali Nafisi, Sadegh Mohammadian, Fatemeh Askari, Mobin Bagherian, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种系统2策略,通过分解大计数任务为小问题来提升LLM计数精度,揭示了计数机制并验证了其有效性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18206 2026-04-21 cs.AI 57%

A Control Architecture for Training-Free Memory Use

无训练记忆使用的控制架构

Yanzhen Lu, Muchen Jiang, Zhicheng Qian, Xingyu Zhou

机构 * Shanghai Qizhi Institute(上海启智研究所) Nanjing Whale Cloud(南京鲸云) Southeast University(东南大学) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种无训练环境下记忆使用的控制方法,通过不确定性路由、置信度选择和记忆银行治理,提升推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14913 2026-04-21 cs.CL 57%

Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages

弥合文化鸿沟:一种基于LLM的数学应用题社会文化本地化的框架

Israel Abebe Azime, Tadesse Destaw Belay, Dietrich Klakow, Philipp Slusallek, Anshuman Chhabra

机构 * Saarland University(萨尔兰大学) Saarland Informatics Campus(萨尔兰信息技术校园) Instituto Politécnico Nacional(墨西哥理工学院) University of South Florida(佛罗里达州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的数学应用题社会文化本地化框架,通过自动构建包含本地名称、组织和货币的本地化数据集,缓解英语中心主义偏差并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16646 2026-04-21 cs.AI 57%

SMART: Self-Generating and Self-Validating Multi-Dimensional Assessment for LLMs' Mathematical Problem Solving

SMART: 自生成和自验证的多维评估用于LLM的数学问题解决

Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(北京市教育厅人工智能教育工程研究中心智能技术与教育应用联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SMART通过分解数学问题解决为四个维度,评估LLM的数学能力,揭示模型在不同维度上的差异,提出All-Pass Score衡量真实问题解决能力。

Comments Need to address additional data or methodological concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17501 2026-04-21 cs.CL 57%

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL 57%

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09536 2026-04-21 cs.CL 57%

Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors

评估大型语言模型对多语言拼写错误的鲁棒性

Raoyuan Zhao, Yihong Liu, Lena Altinger, Hinrich Schütze, Michael A. Hedderich

机构 * Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MulTypo算法,评估18种开源LLM在多语言拼写错误下的表现,发现拼写错误显著降低性能,尤其在生成任务和推理任务中,且语言和任务类型影响鲁棒性,强调需关注噪声训练和多语言鲁棒性评估。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26109 2026-04-17 cs.LG 57%

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

不要踏进同一条河两次:从试错中学习推理

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department, Tencent(腾讯LLM部门)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LTE方法,通过提示模型自身之前的错误来提升推理能力,优于传统方法并在多个数学推理基准上表现更佳。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13902 2026-04-16 cs.LG 57%

DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

DiPO:解耦 perplexity 的策略优化用于细粒度探索-利用平衡

Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang Wang, Zhizhong Zhang, Xin Tan, Yanyun Qu, Lizhuang Ma, Yuan Xie

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出 DiPO 方法,通过解耦 perplexity 空间来优化探索与利用的平衡,提升 LLM 在数学推理和函数调用任务中的性能。

Comments LLM Reinforce Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26519 2026-04-16 cs.LG 57%

Think Outside the Policy: In-Context Steered Policy Optimization

突破政策限制:基于上下文的政策优化

Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department(大模型部门) Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ICPO框架,利用大推理模型的上下文学习能力,通过混合策略GRPO和隐式专家强制扩展探索范围,提升RLVR在数学推理任务中的性能和稳定性。

Comments ACL 2026 Findings. 19 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04256 2026-04-13 cs.CL 57%

SSPO: Subsentence-level Policy Optimization

SSPO:子短语级策略优化

Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao

机构 * Ping An Technology(平安科技) TJUNLP Lab, Tianjin University(天津大学TJUNLP实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 SSPO在子短语层面计算重要性比率,平衡GRPO与GSPO的优劣,缓解训练崩溃和方差问题,同时避免整个响应被保留导致的不稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 57%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 57%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09749 2026-04-07 cs.CE cs.AI 57%

Large Language Models for Combinatorial Optimization of Design Structure Matrix

大型语言模型用于设计结构矩阵的组合优化

Shuo Jiang, Min Xie, Jianxi Luo

机构 * City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的框架,用于优化设计结构矩阵的序列,通过结合网络拓扑和领域知识提升收敛速度和解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02236 2026-04-03 cs.AI 57%

Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models

提示中的情感重要吗?情感框架对大语言模型的影响

Minda Zhao, Yutong Yang, Chufei Peng, Rachel Gonsalves, Weiyue Li, Ruyi Yang, Zhixi Liu, Mengyu Wang

机构 * Harvard University(哈佛大学) Bryn Mawr College(布林莫尔学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了用户查询中第一人称情感框架对大语言模型在六个基准领域性能的影响,发现静态情感前缀通常仅产生小幅度变化,但社交相关任务中效果更不稳定,引入自适应情感提示框架EmotionRL后,适应性选择比固定情感提示更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15929 2026-04-02 cs.AI math.AP math.LO 57%

Semi-Autonomous Formalization of the Vlasov-Maxwell-Landau Equilibrium

半自动化的Vlasov-Maxwell-Landau平衡形式化

Vasily Ilin

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 57%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 57%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25284 2026-03-27 cs.AI 57%

SliderQuant: Accurate Post-Training Quantization for LLMs

SliderQuant: 针对LLMs的准确后训练量化

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Zhonghong Ou, Anbang Yao

机构 * Intel Labs China(英特尔中国研究院) BUPT(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SliderQuant框架,通过分层滑动量化方法优化不同层的量化敏感性,提升LLM在不同位宽下的精度。

Comments This work is accepted to ICLR 2026. Code is available at https://github.com/deep-optimization/SliderQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24904 2026-03-27 cs.AI cs.CR 57%

On the Foundations of Trustworthy Artificial Intelligence

人工智能可信性的基础

TJ Dunham

机构 * ARC

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出确定性推理是可信AI的必要充分条件,并通过信任熵量化非确定性的成本,证明验证失败概率精确为1-2^{-H_T}。通过构建纯整数推断引擎,验证了跨架构模型的确定性,展示了AI信任的本质是算术问题。

Comments 26 pages, 10 tables, 1 figure, 17 theorems/definitions/corollaries

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24375 2026-03-26 cs.CL 57%

Towards Reward Modeling for AI Tutors in Math Mistake Remediation

迈向数学错误纠正中的人工智能导师的奖励建模

Kseniia Petukhova, Ekaterina Kochmar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于人类偏好的人工智能导师奖励建模方法,通过合成数据和加权和数据提升模型准确性,达到0.74的配对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 57%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17074 2026-03-25 cs.LG 57%

PRISM: Demystifying Retention and Interaction in Mid-Training

PRISM:解开中期训练中保留与交互的谜团

Bharat Runwal, Ashish Agrawal, Anurag Roy, Rameswar Panda

机构 * IBM Research, MIT-IBM Watson AI Lab(IBM研究院,MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PRISM通过七种基础模型的受控实验,发现中期训练能显著提升数学、代码和科学基准测试成绩,同时保持整体性能,且数据组成比强化学习更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 57%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏