arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 14 篇

2606.05315 2026-06-05 cs.CL cs.AI 86%

LoRi: Low-Rank Distillation for Implicit Reasoning

LoRi: 用于隐式推理的低秩蒸馏

Ryan Solgi, Jiayi Tian, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 提出低秩蒸馏框架,通过对齐师生模型在共享低秩张量子空间中的隐状态推理轨迹,提升大型语言模型的隐式思维链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05704 2026-06-05 cs.AI cs.LG 81%

Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

基于评论的异构多智能体推理用于可靠的数学问题求解

Muhammad Talha Sharif, Abdul Rehman

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于评论的异构多智能体框架,通过生成器-验证器结构和自适应学习系统,利用中间反馈评估和引导推理过程,在GSM8K基准上实现高达13%的准确率提升,并减少对大模型的依赖。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17310 2026-06-05 cs.AI cs.CL 81%

InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning

InfoDensity: 为高效推理奖励信息密集的轨迹

Chengwei Wei, Jung-jae Kim, Longyin Zhang, Shengkai Chen, Nancy F. Chen

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究机构(I 2 R),A*STAR,新加坡) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfoDensity框架,通过捕捉推理轨迹的信息密度特性,改进强化学习训练中的推理质量与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06252 2026-06-05 cs.AI 79%

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

通过测试时重建实现潜在推理的闭环

Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) Florida State University(佛罗里达州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReLAT方法,利用自监督测试时训练通过查询重建损失优化潜在状态,实现潜在推理的闭环,提升数学推理、知识问答和代码生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25158 2026-06-05 cs.AI 70%

Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills

Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能

Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) Peking University(北京大学) Zhejiang University(浙江大学) Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。

Comments Work in Progress. May version add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05606 2026-06-05 cs.LG cs.AI math.OC 62%

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

跨时代自适应展开优化用于强化学习后训练

Yiming Zong, Yige Wang, Jiashuo Jiang

机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对提示词训练信号差异大的问题,提出CERO方法,通过贝叶斯估计提示词成功概率并利用Fenchel对偶优化自适应分配展开预算,在固定总预算下提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05434 2026-06-05 cs.LG cs.AI 62%

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

选择性优势熵自适应视野GRPO:用于语言模型高效强化学习的非对称令牌级折扣

Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

机构 * Indian Institute of Technology (BHU)(印度理工学院(博生胡大学)) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性优势熵自适应视野GRPO(SA-AH-GRPO),通过非对称令牌级折扣(仅对负优势轨迹应用熵基折扣)来稳定训练并提升数学推理性能。

Comments 16 pages, 4 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25582 2026-06-05 cs.LG cs.AI 62%

Extreme Region Policy Distillation

极端区域策略蒸馏

Changyu Chen, Xiting Wang, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出极端区域策略蒸馏(ERPD)两阶段框架,通过解耦样本效率与KL效率,在固定数据上先进行弱约束离策略优化以最大化提取训练信号,再在信任区域约束下蒸馏到基础策略,从而在数学推理任务中实现更好的性能与更小的KL散度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19327 2026-06-05 cs.LG cs.AI 62%

Soft Sequence Policy Optimization

软序列策略优化

Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软序列策略优化方法,通过引入软门控函数改进序列级重要性权重,提升大语言模型对齐任务的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10823 2026-06-05 cs.CL cs.AI 62%

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

CLASH:从多个视角评估语言模型在高风险困境中的判断

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Philosophy(哲学系) University of Michigan Ann Arbor(安娜堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06428 2026-06-05 cs.CL 57%

Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

强化学习引发对未见语言的上下文翻译学习

Hanxu Hu, Zdeněk Šnajdr, Pinzhen Chen, Jannis Vamvas, Rico Sennrich

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出使用强化学习(RL)方法,以chrF为奖励,使大语言模型从丰富的语言上下文中提取并应用语言学知识,实现对完全未见语言的有效翻译。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06350 2026-06-05 cs.CL 57%

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

EDIT:基于证据诊断的干预训练以实现遵循规则的LLM评分

Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

机构 * King’s College London(伦敦国王学院) University of Cambridge(剑桥大学) AQA The Alan Turing Institute(艾伦·图灵研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出EDIT框架,通过内部模型信号定位推理错误步骤并修正,结合信念引导的奖励塑造,提升LLM评分对评分标准的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06136 2026-06-05 cs.SC cs.AI 57%

A Finite Certificate for the Positive $n=9$ Vasc Inequality

正数 $n=9$ 的 Vasc 不等式的一个有限证书

Dakai Guo, Ruichen Qiu, Yichuan Cao, Ruyong Feng

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, and the School of Mathematics, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院,以及中国科学院大学数学系)

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 通过人工引导的 AI 代理 MechMath Agent Team,将有理不等式转化为齐次多项式不等式,并利用累积间隙参数化所有排序的固定最大值锥体,生成覆盖 40320 个锥体的有限证书,从而证明了正实数 $n=9$ 情况下的 Vasc 循环不等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20345 2026-06-05 stat.ME cs.LG stat.ML 57%

General Synthetic-Powered Inference

通用合成数据驱动推断

Meshi Bashari, Yonghoon Lee, Roy Maor Lotan, Edgar Dobriban, Yaniv Romano

机构 * Department of Electrical and Computer Engineering, Technion IIT, Israel(电气与计算机工程系,技术离子研究所,以色列) Department of Statistics and Data Science, The Wharton School, University of Pennsylvania, USA(统计学与数据科学系,沃顿商学院,宾夕法尼亚大学,美国) Department of Computer Science, Technion IIT, Israel(计算机科学系,技术离子研究所,以色列)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种通用合成数据驱动推断框架,通过结合高质量合成数据和真实数据来提高样本效率,同时在合成数据质量低时自动回退到传统方法,无需分布假设即可保持误差率在用户指定范围内。

详情

展开后加载摘要…

URL PDF HTML 收藏