arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3220 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2604.08577 2026-05-12 cs.LG cs.AI 62%

Distributionally Robust Token Optimization in RLHF

强化学习中对抗性令牌优化

Yeping Jin, Jiaming Hu, Ioannis Ch. Paschalidis

机构 * Department of System Engineering(系统工程系) Boston University(波士顿大学) Department of Math & Statistics(数学与统计学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04783 2026-05-12 cs.AI cs.CL 62%

Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction

打破情境惯性:基于单轮锚点的强化学习用于稳定多轮交互

Xingwu Chen, Zhanqiu Zhang, Yiwen Guo, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLSTA方法,通过单轮锚点提供奖励信号,帮助模型打破情境惯性,提升多轮交互稳定性,实验显示其在不同领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09745 2026-05-12 cs.LG cs.AI cs.IT math.IT 62%

Entropy-informed Decoding: Adaptive Information-Driven Branching

基于熵的信息解码:自适应信息驱动的分支

Benjamin Patrick Evans, Sumitra Ganesh, Leo Ardon

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) JP Morgan AI Research, London, UK(摩根大通AI研究,伦敦,英国) JP Morgan AI Research, New York, USA(摩根大通AI研究,纽约,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDEN解码框架,通过自适应分配计算资源提升生成效率,在数学推理、代码生成等任务中优于传统解码策略。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18880 2026-05-12 cs.CL cs.AI cs.CY 62%

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

LLMs能否估计学生困难?人类-人工智能难度对齐用于项目难度预测的 proficiency 模拟

Ming Li, Han Chen, Yunze Xiao, Jian Chen, Hong Jiao, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) MBZUAI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在估计学生困难方面的表现,发现模型规模扩大并不总能提高准确性,且模型倾向于形成机器共识而非与人类对齐,揭示了当前模型在自动难度预测中的挑战。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08646 2026-05-12 cs.LG cs.CL cs.DC 62%

PAAC: Privacy-Aware Agentic Device-Cloud Collaboration

PAAC:隐私感知的代理设备-云协作

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PAAC框架通过设备-云边界对齐规划-执行分解,使角色专业化成为隐私机制,提升隐私与准确性的平衡,平均准确率提升15-36%,泄漏减少2-6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08441 2026-05-12 cs.LG cs.AI 62%

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

DUET:基于可验证奖励的强化学习中优化令牌预算分配

Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu, Nori Jacoby

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 62%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07331 2026-05-11 cs.LG cs.AI 62%

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

重新思考LLM策略优化中的重要性采样:从累积token视角

Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang

机构 * UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06755 2026-05-11 cs.LG cs.AI 62%

Gradient Extrapolation-Based Policy Optimization

基于梯度外推的策略优化

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) University of Maryland, College Park(马里兰大学学院公园分校) Illinois Institute of Technology(伊利诺伊理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GXPO算法,通过三步反向传播模拟多步前瞻,提升强化学习中大语言模型的推理能力,实验显示在数学推理任务中性能优于GRPO和SFPO。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01003 2026-05-11 cs.LG cs.AI 62%

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05750 2026-05-08 cs.LG cs.CL 62%

RVPO: Risk-Sensitive Alignment via Variance Regularization

基于方差正则化的风险敏感对齐:RVPO

Ivan Montero, Tomasz Jurczyk, Bhuwan Dhingra

机构 * Apple(苹果公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 62%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10150 2026-04-30 cs.LG cs.AI 62%

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

重新思考RLVR中的熵干预:从熵变化视角

Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tencent(腾讯) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 62%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02556 2026-04-28 cs.LG cs.AI 62%

Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs

超越经验检索:学习生成优化的结构化经验以冻结LLM

Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) Quancheng Laboratory(千晨实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SEAM模块,通过单次前向传递生成实例定制的经验条目,优化冻结LLM的执行效率,实验显示在数学推理基准上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19889 2026-04-28 cs.LG cs.AI math.OC 62%

From Optimization to Prediction: Transformer-Based Path-Flow Estimation to the Traffic Assignment Problem

从优化到预测:基于Transformer的路径-流量估计到交通分配问题

Mostafa Ameli, Sulthana Shams, Van Anh Le, Alexander Skabardonis

机构 * Institute of Transportation Studies, University of California, Berkeley, USA(加州大学伯克利分校交通研究学院)

专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于Transformer的深度学习方法,直接预测交通均衡路径流量,提升大规模网络计算效率和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11480 2026-04-28 cs.LG cs.AI 62%

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment

LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22438 2026-04-27 cs.CR cs.AI cs.CL 62%

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

SSG: 用于LLM水印的对数平衡词汇分区

Chenxi Gu, Xiaoning Du, John Grundy

机构 * AllenG-L

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSG方法,通过对数平衡词汇分区提升水印检测效果,针对低熵场景改进水印强度下界。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00931 2026-04-24 cs.LG cs.AI 62%

Continuous-Utility Direct Preference Optimization

连续效用直接偏好优化

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zihao He, Muhammad Usman Rafique, Asad Aali, Muhammad Ali Jamshed, John M. Cioffi, Emily Fox

机构 * stanford(斯坦福大学) meta glasgow(格拉斯哥大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CU-DPO框架,通过连续评分替代二元标签,提升模型在数学推理任务中的策略选择准确率和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20712 2026-04-24 cs.LG cs.CL 62%

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

CE-GPPO:通过梯度保持剪裁策略优化协调熵在强化学习中

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Independent(独立)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CE-GPPO算法,通过恢复剪裁令牌的梯度信号,协调探索与利用,缓解熵不稳定问题,并在数学推理任务中优于现有方法。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18629 2026-04-24 cs.LG cs.AI 62%

HyperAdapt: Simple High-Rank Adaptation

HyperAdapt: 简单的高秩适应

Abel Gurung, Joseph Campbell

机构 * Purdue University(普渡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HyperAdapt通过高秩更新减少可训练参数,实现高效的微调,在多个基准测试中表现接近全微调方法。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21373 2026-04-23 cs.LG cs.CL 62%

PLR: Plackett-Luce for Reordering In-Context Learning Examples

PLR:基于Plackett-Luce模型的上下文学习示例重排

Pawel Batorski, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(杜塞尔多夫海因里希-海涅大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PLR提出一种基于Plackett-Luce模型的概率方法,通过学习上下文学习示例的排列概率分布,提高小样本分类任务的准确性,尤其在数学推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 62%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16535 2026-04-22 cs.LG cs.AI 62%

SCATR: Simple Calibrated Test-Time Ranking

SCATR: 简单校准的测试时间排名

Divya Shyamal, Marta Knežević, Lan Tran, Chanakya Ekbote, Vijay Lingam, Paul Pu Liang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SCATR通过利用基础模型的隐藏表示,从小型校准集学习轻量级评分器,提升了测试时间排名的效率和准确性,在多个基准测试中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17695 2026-04-21 cs.LG cs.CL 62%

MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

MoE-nD:多轴KV缓存压缩的分层专家路由

Libo Sun, Peixiong He, Po-Wei Harn, Xiao Qin

机构 * Department of Computer Science and Software Engineering, Auburn University, Auburn, AL, USA(计算机科学与软件工程系,阿伯拉罕大学,阿伯丁,阿拉巴马州,美国) Department of Information Management, National Central University, Taoyuan, Taiwan(信息管理系,国立中央大学,桃园,台湾)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MoE-nD方法,通过分层专家路由实现多轴KV缓存压缩,优化每层的缓存策略以提升模型性能,实验表明其在多个基准测试中表现优异。

Comments 9 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17290 2026-04-21 cs.CL cs.AI cs.PL 62%

Probabilistic Programs of Thought

思维概率程序

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck

机构 * University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(Allen人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI 62%

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17068 2026-04-21 cs.CL cs.LG 62%

Stability-Weighted Decoding for Diffusion Language Models

扩散语言模型的稳定性加权解码

Yue Wu, Jian Huang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong, China(数据科学与人工智能系,香港理工大学,香港,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出稳定性加权解码方法,通过引入时间稳定性提升扩散语言模型的生成准确性与鲁棒性,实验表明其在代码生成和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16935 2026-04-21 cs.AI cs.CY cs.HC cs.LG cs.SI 62%

LLMs can persuade only psychologically susceptible humans on societal issues, via trust in AI and emotional appeals, amid logical fallacies

LLMs只能通过信任AI和情感诉求说服心理上易受影响的人群在社会问题上的观点,尽管存在逻辑谬误

Alexis Carrillo, Salvatore Citraro, Ali Aghazhadeh Ardebili, Enrique Taietta, Giulio Rossetti, Emilio Ferrara, Giuseppe Alessandro Veltri, Massimo Stella

机构 * organization= CogNosco Lab, Department of Psychology Cognitive Science, University of Trento , city= Rovereto , country= Italy organization= Institute of Information Science Technologies ``Alessandro Faedo", National Research Council , country= Italy organization= Thomas Lord Department of Computer Science, University of Southern California , city= Los Angeles , state= California , country= USA organization= Department of Sociology Social Research, University of Trento , city= Trento , country= Italy organization= Centre for Behavioural Implementation Sciences in Medicine (BISI), National University of Singapore , city= Singapore , country= Singapore

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过Talk2AI框架研究LLM在时间演变的心理框架下对社会议题的说服力,发现人类对AI的可信度和情感诉求影响其观点变化,同时揭示了逻辑谬误在说服过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16259 2026-04-20 cs.LG cs.AI 62%

Beyond Distribution Sharpening: The Importance of Task Rewards

超越分布细化:任务奖励的重要性

Sarthak Mittal, Leo Gagnon, Guillaume Lajoie

机构 * Mila Université de Montréal(蒙特利尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比分布细化与基于任务奖励的学习,揭示了任务奖励在提升模型性能中的关键作用,实验表明任务奖励能带来更稳定的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏