arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2603.04135 2026-03-05 cs.LG cs.AI 62%

Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization

无偏动态剪枝用于高效基于群体的策略优化

Haodong Zhu, Yangyang Ren, Yanjing Li, Mingbao Lin, Linlin Yang, Xuhui Liu, Xiantong Zhen, Haiguang Liu, Baochang Zhang

机构 * Beihang University(北航大学) Zhongguancun Academy(中关村学院) Communication University of China(中国通信大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DPPO通过动态剪枝和重要性采样修正,实现高效基于群体的策略优化,提升训练速度并提高准确率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03112 2026-03-05 cs.CL cs.AI cs.CY 62%

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

RLVER: 通过可验证情绪奖励的强化学习实现共情代理

Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen, Zhiwei He, Kang Luo, Qingsong Lv, Qingxuan Jiang, Zheng Xie, Shanyi Wang, Yuan Li, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RLVER通过可验证情绪奖励提升LLM的共情能力,实验显示其在对话任务中显著提升表现,尤其在情感理解和洞察力方面成效显著。

Comments Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10625 2026-03-04 cs.CL cs.AI 62%

No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes

无需答案:从仅问题的线性探针预测LLM答案准确性

Iván Vicente Moreno Cencerrado, Arnau Padrés Masdemont, Anton Gonzalvez Hawthorne, David Demitri Africa, Lorenzo Pacchiardi

机构 * Universidad Internacional de Valencia(瓦伦西亚国际大学) University of Cambridge(剑桥大学) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过线性探针预测LLM答案准确性,发现模型在中间层预测能力饱和,但对数学推理问题泛化能力下降,揭示了LLM内部机制。

Comments Accepted (poster) to Principled Design for Trustworthy AI at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02232 2026-03-04 cs.LG cs.AI 62%

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

超越二元偏好:基于顺序反馈的奖励建模原理框架

Amirhossein Afsharrad, Ruida Zhou, Luca Viano, Sanjay Lall, Mohammad Ghavamzadeh

机构 * Stanford University(斯坦福大学) Amazon AGI(亚马逊人工智能研究) EPFL(瑞士联邦理工学院) Qualcomm AI Research(高通人工智能研究) Aktus AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07430 2026-03-04 cs.LG cs.AI 62%

The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward

分歧选择:一种缓解强化学习中多样性崩溃的关键因素

Long Li, Zhijian Zhou, Jiaran Hao, Jason Klein Liu, Yanting Miao, Wei Pang, Xiaoyu Tan, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) INFLY TECH(INFLY科技) Griffith University(格里菲斯大学) University of Waterloo(滑铁卢大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPH-RL框架,通过利用f散度作为复习机制,解决强化学习中多样性崩溃问题,提升模型在不同领域的表现。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17616 2026-03-03 cs.LG cs.AI 62%

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01563 2026-03-03 cs.LG cs.AI 62%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01335 2026-03-03 cs.LG cs.AI 62%

Provable and Practical In-Context Policy Optimization for Self-Improvement

可证明且实用的上下文内策略优化用于自我改进

Tianrun Yu, Yuxiao Yang, Zhaoyang Wang, Kaixiang Zhao, Porter Jenkins, Xuchao Zhang, Chetan Bansal, Huaxiu Yao, Weitong Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPO方法,通过上下文内自我反思和最小熵优化,在保持低推理成本的同时实现数学推理任务的高性能

Comments 34 pages, 8 tables, 4 figures, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01089 2026-03-03 cs.CL cs.LG 62%

CARD: Towards Conditional Design of Multi-agent Topological Structures

CARD: 向多智能体拓扑结构的条件设计迈进

Tongtong Wu, Yanming Li, Ziye Tang, Chen Jiang, Linhao Luo, Guilin Qi, Shirui Pan, Gholamreza Haffari

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CARD通过条件图生成框架实现多智能体通信拓扑的动态适应,提升系统在不同环境下的有效性和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 62%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03324 2026-03-03 cs.LG cs.AI 62%

Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs

缓存什么更持久:用于LLMs中内存受限KV缓存的令牌保留

Ngoc Bui, Shubham Sharma, Simran Lamba, Saumitra Mishra, Rex Ying

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) JPMorganChase AI Research(摩根大通人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TRIM-KV通过学习令牌的内在重要性实现内存受限的KV缓存优化,有效提升LLM在低内存环境下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02881 2026-03-03 cs.LG cs.AI 62%

Rewriting Pre-Training Data Boosts LLM Performance in Math and Code

重写预训练数据提升LLM在数学和代码上的表现

Kazuki Fujii, Yukito Tajima, Sakae Mizuki, Masaki Kawamura, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Masanari Oi, Taishi Nakamura, Takumi Okamoto, Shigeki Ishida, Kakeru Hattori, Youmi Ma, Hiroya Takamura, Rio Yokota, Jun Sakuma, Naoaki Okazaki

机构 * Institute of Science Tokyo, Department of Computer Science(东京科学研究所,计算机科学系) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Institute of Science Tokyo, Institute of Integrated Research, Supercomputing Research Center(东京科学研究所,整合研究所,超级计算研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过重写预训练数据提升LLM在数学和代码任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23546 2026-03-02 cs.CL cs.AI 62%

Humans and LLMs Diverge on Probabilistic Inferences

人类与大语言模型在概率推断上存在分歧

Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de Marneffe, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) University of Vienna(维也纳大学) FNRS – UCLouvain(佛罗伦萨-鲁汶大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ProbCOPA数据集研究人类与大语言模型在概率推断上的差异,发现模型在非确定性推理上表现不足,揭示了人类与LLM在推理模式上的根本差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22296 2026-02-27 cs.LG cs.AI 62%

UpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMs

UpSkill: 为大语言模型的结构化响应多样性进行互信息技能学习

Devan Shah, Owen Yang, Daniel Yang, Chongyi Zheng, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 UpSkill通过互信息技能学习提升大语言模型在结构化响应多样性中的表现,提高pass@k准确性而不影响pass@1。

Comments First two authors equal contribution. 29 pages total (11 pages main text), 10 figures, 10 tables. Project website: https://dshah.io/upskill/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21269 2026-02-26 cs.LG cs.AI stat.ML 62%

Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space

群体正交化策略优化:将群体策略优化视为希尔伯特空间中的正交投影

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过正交投影在希尔伯特空间中优化群体策略,实现精确稀疏性和稳定梯度动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10947 2026-02-26 cs.AI cs.LG 62%

Spurious Rewards: Rethinking Training Signals in RLVR

虚假奖励:重新思考强化学习中的训练信号

Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer

机构 * University of Washington, Seattle, WA, USA(华盛顿大学) Allen Institute for Artificial Intelligence, Seattle, WA, USA(人工智能研究院) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,即使使用随机分配的虚假奖励,强化学习方法也能在某些模型上显著提升性能,凸显了验证训练信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG 62%

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10604 2026-02-24 cs.CL cs.AI 62%

Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters

步骤3.5 Flash:通过11B活跃参数实现前沿级智能

Ailin Huang, Ang Li, Aobo Kong, Bin Wang, Binxing Jiao, Bo Dong, Bojun Wang, Boyu Chen, Brian Li, Buyun Ma, Chang Su, Changxin Miao, Changyi Wan, Chao Lou, Chen Hu, Chen Xu, Chenfeng Yu, Chengting Feng, Chengyuan Yao, Chunrui Han, Dan Ma, Dapeng Shi, Daxin Jiang, Dehua Ma, Deshan Sun, Di Qi, Enle Liu, Fajie Zhang, Fanqi Wan, Guanzhe Huang, Gulin Yan, Guoliang Cao, Guopeng Li, Han Cheng, Hangyu Guo, Hanshan Zhang, Hao Nie, Haonan Jia, Haoran Lv, Hebin Zhou, Hekun Lv, Heng Wang, Heung-Yeung Shum, Hongbo Huang, Hongbo Peng, Hongyu Zhou, Hongyuan Wang, Houyong Chen, Huangxi Zhu, Huimin Wu, Huiyong Guo, Jia Wang, Jian Zhou, Jianjian Sun, Jiaoren Wu, Jiaran Zhang, Jiashu Lv, Jiashuo Liu, Jiayi Fu, Jiayu Liu, Jie Cheng, Jie Luo, Jie Yang, Jie Zhou, Jieyi Hou, Jing Bai, Jingcheng Hu, Jingjing Xie, Jingwei Wu, Jingyang Zhang, Jishi Zhou, Junfeng Liu, Junzhe Lin, Ka Man Lo, Kai Liang, Kaibo Liu, Kaijun Tan, Kaiwen Yan, Kaixiang Li, Kang An, Kangheng Lin, Lei Yang, Liang Lv, Liang Zhao, Liangyu Chen, Lieyu Shi, Liguo Tan, Lin Lin, Lina Chen, Luck Ma, Mengqiang Ren, Michael Li, Ming Li, Mingliang Li, Mingming Zhang, Mingrui Chen, Mitt Huang, Na Wang, Peng Liu, Qi Han, Qian Zhao, Qinglin He, Qinxin Du, Qiuping Wu, Quan Sun, Rongqiu Yang, Ruihang Miao, Ruixin Han, Ruosi Wan, Ruyan Guo, Shan Wang, Shaoliang Pang, Shaowen Yang, Shengjie Fan, Shijie Shang, Shiliang Yang, Shiwei Li, Shuangshuang Tian, Siqi Liu, Siye Wu, Siyu Chen, Song Yuan, Tiancheng Cao, Tianchi Yue, Tianhao Cheng, Tianning Li, Tingdan Luo, Wang You, Wei Ji, Wei Yuan, Wei Zhang, Weibo Wu, Weihao Xie, Wen Sun, Wenjin Deng, Wenzhen Zheng, Wuxun Xie, Xiangfeng Wang, Xiangwen Kong, Xiangyu Liu, Xiangyu Zhang, Xiaobo Yang, Xiaojia Liu, Xiaolan Yuan, Xiaoran Jiao, Xiaoxiao Ren, Xiaoyun Zhang, Xin Li, Xin Liu, Xin Wu, Xing Chen, Xingping Yang, Xinran Wang, Xu Zhao, Xuan He, Xuanti Feng, Xuedan Cai, Xuqiang Zhou, Yanbo Yu, Yang Li, Yang Xu, Yanlin Lai, Yanming Xu, Yaoyu Wang, Yeqing Shen, Yibo Zhu, Yichen Lv, Yicheng Cao, Yifeng Gong, Yijing Yang, Yikun Yang, Yin Zhao, Yingxiu Zhao, Yinmin Zhang, Yitong Zhang, Yixuan Zhang, Yiyang Chen, Yongchi Zhao, Yongshen Long, Yongyao Wang, Yousong Guan, Yu Zhou, Yuang Peng, Yuanhao Ding, Yuantao Fan, Yuanwei Lu, Yuanzhen Yang, Yuchu Luo, Yudi Zhao, Yue Peng, Yueqiang Lin, Yufan Lu, Yuling Zhao, Yunzhou Ju, Yurong Zhang, Yusheng Li, Yuxiang Yang, Yuyang Chen, Yuzhu Cai, Zejia Weng, Zetao Hong, Zexi Li, Zhe Xie, Zheng Ge, Zheng Gong, Zheng Zeng, Zhenyi Lu, Zhewei Huang, Zhichao Chang, Zhiguo Huang, Zhiheng Hu, Zidong Yang, Zili Wang, Ziqi Ren, Zixin Zhang, Zixuan Wang

机构 * StepFun Team(StepFun团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Step 3.5 Flash通过11B活跃参数实现前沿级智能,结合高效推理与多任务表现,提升代理在数学、代码等领域的性能。

Comments Technical report for Step 3.5 Flash

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19208 2026-02-24 cs.LG cs.AI 62%

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

如何分配,如何学习?动态回放分配与优势调节用于策略优化

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 62%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17288 2026-02-20 cs.AI cs.CL 62%

ArXiv-to-Model: A Practical Study of Scientific LM Training

ArXiv-to-Model:科学语言模型训练的实践研究

Anuj Gupta

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过从arXiv LaTeX源数据直接训练科学语言模型,探讨了预处理、分词和计算资源对模型训练的影响,提供了工程层面的训练实践与透明分析。

Comments 15 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00794 2026-02-20 cs.LG cs.AI 62%

Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration

为大语言模型高效强化学习引入内在探索

Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang

机构 * National University of Singapore(新加坡国立大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00539 2026-02-18 cs.CL cs.AI 62%

Intermittent Semi-Working Mask: A New Masking Paradigm for LLMs

间歇半工作掩码:一种新的LLM掩码范式

HaoYuan Hu, Mingcong Lu, Di Luo, XinYa Wu, Jiangcai Zhu, Taoye Yin, Zheng Li, Hao Wang, Shusheng Zhang, KeZun Zhang, KaiLai Shao, Chao Chen, Feng Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 间歇半工作掩码通过引入稀疏双向注意力,实现高效多轮对话和上下文密集型任务处理,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 62%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03195 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning with Promising Tokens for Large Language Models

基于有前景标记的强化学习用于大语言模型

Jing-Cheng Pang, Liang Lu, Xian Tang, Kun Jiang, Sijie Wu, Kai Zhang, Xubin Li

机构 * huawei(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 基于有前景标记的强化学习框架通过解耦战略决策与标记生成,有效提升大语言模型的训练稳定性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12172 2026-02-13 cs.AI cs.CL 62%

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

教学启发式数据合成用于语言模型知识蒸馏

Bowei He, Yankai Chen, Xiaokun Zhang, Linghe Kong, Philip S. Yu, Xue Liu, Chen Ma

机构 * MBZUAI McGill(麦吉尔大学) CityUHK(城市大学香港分校) SJTU(上海交通大学) UIC(美国国际大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于教学原理的知识蒸馏框架,通过三阶段流程提升学生模型性能,在复杂推理任务中取得显著改进。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09718 2026-02-12 cs.CL cs.AI 62%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09173 2026-02-11 cs.LG cs.AI 62%

$n$-Musketeers: Reinforcement Learning Shapes Collaboration Among Language Models

$n$-Musketeers: 通过强化学习塑造语言模型间的协作

Ryozo Masukawa, Sanggeon Yun, Hyunwoo Oh, SuhgHeon Jeong, Raheeb Hassa, Hanning Chen, Wenjun Huang, Mahdi Imani, Pietro Mercati, Nathaniel D. Bastian, Mohsen Imani

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软隐藏状态协作方法,通过可训练的注意力接口整合多个冻结的SLM专家,实验证明其在推理任务中与强基线竞争,并揭示了专家利用的双机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17668 2026-02-10 cs.LG cs.CL 62%

Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction

快速KVzip:基于门控的KV缓存淘汰实现高效且准确的LLM推理

Jang-Hyun Kim, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 基于门控的KV缓存淘汰方法实现高效且准确的LLM推理,通过轻量级门控模块和任务无关的重建目标,实现高压缩比和低计算开销。

Comments Source code: https://github.com/Janghyun1230/FastKVzip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05494 2026-02-10 cs.LG cs.AI 62%

A Unified Framework for Rethinking Policy Divergence Measures in GRPO

在GRPO中重新思考策略分歧度度量的统一框架

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的裁剪框架,通过KL3估计器改进GRPO,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏