arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2601.00942 2026-01-06 cs.LG cs.CL 62%

Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures

可靠性与随机性:在解码温度下对稀疏和密集语言模型的实证分析

Kabir Grover

机构 * Kabir Grover(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了稀疏和密集语言模型在不同解码温度下的可靠性,发现指令微调比架构稀疏性对稳定性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00874 2026-01-06 cs.LG cs.AI physics.comp-ph 62%

LLMize: A Framework for Large Language Model-Based Numerical Optimization

LLMize: 一种基于大语言模型的数值优化框架

M. Rizki Oktavian

机构 * Blue Wave AI Labs(蓝波人工智能实验室) School of Nuclear Engineering, Purdue University(核工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMize是一种基于大语言模型的数值优化框架,通过自然语言描述注入约束和领域知识,适用于复杂领域特定任务的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00448 2026-01-05 cs.CL cs.AI 62%

Language as Mathematical Structure: Examining Semantic Field Theory Against Language Games

语言作为数学结构:对语义场理论与语言游戏的检验

Dimitris Vartziotis

机构 * TWT Science & Innovation(TWT科学与创新) NIKI - Digital Engineering(NIKI数字工程)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比语义场理论与语言游戏,探讨语言的数学结构与社会建构的互补性,提出新的理论指导AI架构的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16989 2026-01-05 cs.LG cs.AI 62%

PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models

PTQTP: 预训练量化到三平面用于大语言模型

He Xiao, Runming Yang, Qingyao Yang, Wendong Xu, Zhen Li, Yupeng Su, Zhengwu Liu, Hongxia Yang, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PTQTP通过分解权重矩阵为三平面实现高效大语言模型量化,提升推理速度并减少资源消耗。

Comments Ternary Quantization, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22492 2025-12-30 cs.DC cs.AI cs.LG 62%

Role-Based Fault Tolerance System for LLM RL Post-Training

基于角色的LLM强化学习后训练容错系统

Zhenqian Chen, Baoquan Zhong, Xiang Li, Qing Dai, Xinkui Zhao, Miao Ye, Ren Cheng, Lufei Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RobustRL通过基于角色的故障隔离技术,有效提升LLM强化学习后训练的容错性能,实现训练时间比率提升80%以上。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI 62%

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02833 2025-12-23 cs.LG cs.CL 62%

In Good GRACEs: Principled Teacher Selection for Knowledge Distillation

在良好的GRACE中:为知识蒸馏选择原则性教师

Abhishek Panigrahi, Bingbin Liu, Sadhika Malladi, Sham Kakade, Surbhi Goel

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Kempner Institute, Harvard(哈佛凯普纳研究所) Microsoft Research, New York(微软研究院(纽约)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 GRACE通过量化教师有效性,为知识蒸馏提供原则性教师选择和蒸馏指导,提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17636 2025-12-22 cs.LG cs.AI 62%

Trust-Region Adaptive Policy Optimization

信任区域自适应策略优化

Mingyu Su, Jian Guan, Yuxian Gu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group, Tsinghua University(清华大学对话式人工智能(CoAI)小组)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRAPO通过结合SFT和RL的训练流程,提升大语言模型的推理能力,实现更稳定的训练和更高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14954 2025-12-18 cs.CL cs.LG 62%

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

跨分词器似然评分算法用于语言模型蒸馏

Buu Phan, Ashish Khisti, Karen Ullrich

机构 * University of Toronto(多伦多大学) Meta AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出跨分词器似然评分算法,通过BPE递归结构解决词汇不匹配问题,提升蒸馏效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13063 2025-12-16 cs.CL cs.AI 62%

LLM Rationalis? Measuring Bargaining Capabilities of AI Negotiators

LLM Rationalis? 测量AI谈判者的协商能力

Cheril Shah, Akshit Agarwal, Kanak Garg, Mourad Heddaya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI谈判者的协商能力,发现LLMs在谈判中系统性地锚定在极端位置,缺乏策略多样性,且协商能力不随模型改进而提升。

Comments Published in the First Workshop on Multi-Turn Interactions in Large Language Models at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07522 2025-12-09 cs.CL cs.AI 62%

LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings

LIME:通过语言元数据嵌入使LLM数据更高效

Sebastian Sztwiertnia, Felix Friedrich, Kristian Kersting, Patrick Schramowski, Björn Deiseroth

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LIME通过语言元数据嵌入提升LLM预训练效率,显著增强语言建模和生成任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06449 2025-12-09 cs.LG cs.AI 62%

FLEX: Continuous Agent Evolution via Forward Learning from Experience

FLEX: 通过经验向前学习实现连续智能体进化

Zhicheng Cai, Xinyuan Guo, Yu Pei, Jiangtao Feng, Jinsong Su, Jiangjie Chen, Ya-Qin Zhang, Wei-Ying Ma, Mingxuan Wang, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) ByteDance Seed(字节跳动种子) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Informatics, Xiamen University(厦门大学信息学院) SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR实验室和字节跳动种子)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FLEX通过经验向前学习实现LLM智能体的持续进化,提升数学推理、化学逆合成和蛋白质预测性能,并揭示经验增长的扩展规律和跨智能体的经验继承现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11227 2025-12-09 cs.AI cs.LG 62%

Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs

PRM是否必要?问题解决RL隐式地在LLMs中诱导PRM能力

Zhangying Feng, Qianglong Chen, Ning Lu, Yongqian Li, Siqi Cheng, Shuangmu Peng, Duyu Tang, Shengcai Liu, Zhirui Zhang

机构 * Huawei Technologies Ltd.(华为技术有限公司) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(广东省脑启发智能计算重点实验室、信息科学部、南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现纯RL训练可提升LLMs的推理能力并隐式诱导PRM能力,挑战了PRM的必要性。

Comments Accepted by NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06678 2025-12-09 cs.LG cs.AI 62%

GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning

GradientSpace: 无监督数据聚类以提升指令微调

Shrihari Sridharan, Deepak Ravikumar, Anand Raghunathan, Kaushik Roy

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GradientSpace通过直接在梯度空间中聚类样本,提升指令微调效果,减少推理延迟并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12398 2025-11-27 cs.CR cs.AI cs.CL 62%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24068 2025-11-24 cs.LG cs.AI 62%

A Small Math Model: Recasting Strategy Choice Theory in an LLM-Inspired Architecture

一个小数学模型:在LLM启发式架构中重构策略选择理论

Roussel Rahman, Jeff Shrager

机构 * Stanford University(斯坦福大学) Bennu Climate, Inc.(Bennu气候公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM架构的小数学模型,重构策略选择理论,扩展其功能并研究数学推理中的数字特征与关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20039 2025-11-21 cs.CL cs.LG 62%

AutoJudge: Judge Decoding Without Manual Annotation

AutoJudge: 无需人工标注的判断解码

Roman Garipov, Fedor Velikonivtsev, Ivan Ermakov, Ruslan Svirschevski, Vage Egiazarian, Max Ryabinin

机构 * HSE University(俄罗斯高等经济学院) Yandex IST Austria(国际应用数学研究所) Together AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 AutoJudge通过任务特定的损失性推测解码加速LLM推理,无需人工标注,实现显著速度提升并牺牲少量准确性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16080 2025-11-21 cs.PL cs.AI cs.LG 62%

Operon: Incremental Construction of Ragged Data via Named Dimensions

Operon:通过命名维度逐步构建不规则数据

Sungbin Moon, Jiho Park, Suyoung Hwang, Donghyun Koh, Seunghyun Moon, Minhyeong Lee

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Operon通过命名维度形式化方法,实现对不规则数据的逐步构建,提升大规模数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24021 2025-11-18 cs.CL cs.AI 62%

SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs

Haiduo Huang, Jiangcheng Song, Yadong Zhang, Pengju Ren

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09873 2025-11-14 cs.CL cs.LG 62%

HierRouter: Coordinated Routing of Specialized Large Language Models via Reinforcement Learning

Nikunj Gupta, Bill Guo, Rajgopal Kannan, Viktor K. Prasanna

机构 * David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon大学计算机科学系) University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03222 2025-11-10 cs.LG cs.CL 62%

Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward

Guanhua Huang, Tingqiang Xu, Mingze Wang, Qi Yi, Xue Gong, Siheng Li, Ruibin Xiong, Kejiao Li, Yuhao Jiang, Bo Zhou

机构 * LLM Department, Tencent(腾讯大模型部门) Tsinghua University(清华大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00102 2025-11-04 cs.LG cs.AI 62%

Automated Discovery of Conservation Laws via Hybrid Neural ODE-Transformers

Vivan Doshi

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG

Comments 5th Math-AI Workshop - Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26658 2025-10-31 cs.AI cs.CL 62%

The Era of Agentic Organization: Learning to Organize with Language Models

Zewen Chi, Li Dong, Qingxiu Dong, Yaru Hao, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25776 2025-10-31 cs.CL cs.LG 62%

StreetMath: Study of LLMs' Approximation Behaviors

Chiung-Yi Tseng, Somshubhra Roy, Maisha Thasin, Danyang Zhang, Blessing Effiong

机构 * LuxMuse AI(LuxMuse人工智能公司) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电气与计算机工程系) Department of Mathematics, University of Waterloo(滑铁卢大学数学系) Vokram Group(Vokram集团) Department of Computer Science, Saint Louis University(圣路易斯大学计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01369 2025-10-31 cs.LG cs.AI 62%

Incentivizing LLMs to Self-Verify Their Answers

Fuxiang Zhang, Jiacheng Xu, Chaojie Wang, Ce Cui, Yang Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Skywork AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14604 2025-10-31 cs.CL cs.AI 62%

Let LRMs Break Free from Overthinking via Self-Braking Tuning

Haoran Zhao, Yuchen Yan, Yongliang Shen, Haolei Xu, Wenqi Zhang, Kaitao Song, Jian Shao, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025; Camera ready version, 10 pages. Github:https://github.com/ZJU-REAL/Self-Braking-Tuning Project Page: https://ZJU-REAL.github.io/SBT

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12571 2025-10-30 cs.CE cs.AI cs.CL 62%

Large Language Models for Combinatorial Optimization of Design Structure Matrix

Shuo Jiang, Min Xie, Jianxi Luo

机构 * City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref Proc. Des. Soc. 5 (2025) 2201-2210

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10978 2025-10-29 cs.LG cs.AI 62%

Group-in-Group Policy Optimization for LLM Agent Training

Lang Feng, Zhenghai Xue, Tingcong Liu, Bo An

机构 * Nanyang Technological University(南洋理工大学) Skywork AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22852 2025-10-28 cs.LG cs.AI 62%

Encoder-Decoder Diffusion Language Models for Efficient Training and Inference

Marianne Arriola, Yair Schiff, Hao Phung, Aaron Gokaslan, Volodymyr Kuleshov

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. We provide the code at https://github.com/kuleshov-group/e2d2

详情

展开后加载摘要…

URL PDF HTML 收藏