arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 34 篇

2605.24286 2026-05-26 cs.LG cs.CL 91%

Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

忠实性作为信息流:评估与训练忠实的链式思维推理

Jinghan Jia, Joe Benton, Eric Easley

机构 * Dept. CSE, Michigan State University(密歇根州立大学计算机科学系) Anthropic

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);verifier(abstract)

AI总结 通过信息流视角提出基于充分性、完整性和必要性的框架,结合熵、掩码KL和梯度诊断评估链式思维忠实性,并引入更新时干预(如注意力掩码、反向梯度掩码等)训练更忠实的推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24867 2026-05-26 cs.AI cs.CL cs.NI 91%

Clustering as Reasoning: A $k$-Means Interpretation of Chain-of-Thought Graph Learning

聚类即推理:思维链图学习的 $k$-均值解释

Xuanting Xie, Zhaochen Guo, Bingheng Li, Xingtong Yu, Zhifei Liao, Zhao Kang, Yuan Fang

机构 * University of Electronic Science and Technology of China(电子科技大学) Singapore Management University(新加坡国立大学) Michigan State University(密歇根州立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出KCoT框架,通过将Transformer块与$k$-均值算法建立数学对应,将思维链推理与图表示学习统一,实现迭代语义-拓扑交互,在标准基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25745 2026-05-26 cs.CL 87%

Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains

选择性潜在思考:LLM推理链的自适应压缩

Hui Xie, Jie Liu, Ziyue Qiao, Joaquin Vanschore

机构 * Eindhoven University of Technology(埃因霍温理工大学) School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出选择性潜在思考(SLT)框架,通过置信度门控将冗余推理步骤压缩为潜在表示,关键步骤保留显式思维链,在压缩比相当的情况下准确率比潜在推理基线高22.7%,推理链长度减少58.4%且准确率仅下降2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25977 2026-05-26 cs.CL cs.AI cs.LG 87%

Creative Quality Alignment: Expert Tacit Knowledge Transfer via Chain-of-Thought Fine-Tuning

创意质量对齐:通过思维链微调实现专家隐性知识迁移

Bo Zou, Chao Xu

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19988 2026-05-26 cs.CL 83%

AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios

AgentCoMa:一个混合常识与数学推理的现实场景组合基准

Lisa Alazraki, Lihu Chen, Ana Brassard, Joe Stacey, Hossein A. Rahmani, Marek Rei

机构 * Imperial College London(帝国理工学院伦敦分校) RIKEN(日本研究机构) University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出AgentCoMa基准,测试大语言模型在组合常识与数学推理任务上的性能,发现模型在单独步骤上准确率高但组合后平均下降近30%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24876 2026-05-26 cs.CV cs.CL 83%

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

Agent-X:评估视觉中心智能体任务中的深度多模态推理

Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of Central Florida(中央佛罗里达大学) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出Agent-X基准,通过828个真实视觉任务和细粒度步骤评估框架,揭示当前模型在多步视觉推理中全链成功率低于50%的瓶颈。

Comments Accepted in International Conference of Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10538 2026-05-26 stat.ML cs.LG 83%

Why Agentic Theorem Prover Works: A Statistical Provability Theory of Mathematical Reasoning Models

为什么智能体定理证明器有效:数学推理模型的统计可证明性理论

Sho Sonoda, Shunta Akiyama, Yuya Uezato

机构 * CyberAgent, Inc.(CyberAgent公司) National Institute of Informatics, Japan(日本信息机构)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文通过统计可证明性理论,将形式化证明搜索建模为有限视界可达性MDP,分析了智能体定理证明器中各组件对有限预算下证明成功率的影响,并给出了成功率差距的误差界。

Comments accepted at icml2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16302 2026-05-26 cs.LG cs.AI cs.CL 82%

Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

通过反事实推理路径减少信用分配方差

Fei Ding, Yongkang Zhang, Youwei Wang, Zijian Zeng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出反事实比较框架,通过采样多条推理轨迹并利用差异隐式估计过程级优势,将稀疏终端奖励转化为步骤敏感信号,从而改进大语言模型多步推理的信用分配,并引入隐式行为策略优化(IBPO)提升训练稳定性和性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02979 2026-05-26 cs.CL cs.LG 81%

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

CPMobius: 无数据强化学习的迭代式教练-玩家推理

Ran Li, Zeyuan Liu, Yinghao Chen, Bingxiang He, Jiarui Yuan, Zixuan Fu, Weize Chen, Jinyi Hu, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出CPMobius协作式教练-玩家范式,通过无外部数据的合作优化循环提升数学推理能力,在Qwen2.5-Math-7B-Instruct上总体准确率提升4.9%,OOD准确率提升5.4%。

Comments Accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24613 2026-05-26 cs.CL cs.AI cs.SE 81%

Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning

Guarded Repair: 面向危害感知的LLM数学推理事后替换

Haizhou Xia

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出GuardedRepair框架,通过选择性替换机制在修复LLM数学推理错误时避免破坏正确结果,在GSM8K上准确率从95.60%提升至96.89%且未破坏正确案例。

Comments 15 pages,including appendices. Code and artifacts available at https://github.com/Haizhoux0517/guarded-repair

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16778 2026-05-26 cs.LG cs.AI 81%

Federation over Text: Insight Sharing for Multi-Agent Reasoning

文本上的联邦:多智能体推理的洞察共享

Dixi Yao, Tahseen Rabbani, Manzil Zaheer, Tian Li

机构 * University of Chicago(芝加哥大学) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种类似联邦学习的框架FoT,通过迭代聚合多个客户端的本地推理过程,构建跨任务元认知洞察库,无需共享问题实例或任务指令,显著提升推理效果和效率。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13323 2026-05-26 cs.AI cs.LG 81%

Error-Driven Prompt Optimization for Arithmetic Reasoning

基于错误驱动的算术推理提示优化

Árpád Pándy, Róbert Lakatos, András Hajdu

机构 * Deptartment of Data Science & Visualization, Faculty of Informatics, University of Debrecen(数据科学与可视化系,信息学院,德布勒恩大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种错误驱动的提示优化框架,通过聚类错误预测迭代优化提示规则,使小型本地语言模型在算术推理任务中准确率达到70.8%,超越GPT-3.5 Turbo。

Journal ref IEEE Access, vol. 14, pp. 62570-62583, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23926 2026-05-26 cs.AI cs.LG 81%

How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning

多少思考才足够?量化和理解LLM推理中的冗余

Zhiyuan Zhai, Xinkai You, Wenjing Yan, Xin Wang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过形式化推理冗余度量,量化了前沿推理模型在数学基准上高达61%-93%的步骤级冗余,并证明这种冗余是长度无关结果奖励的结构性后果,而非模型特定伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 79%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25065 2026-05-26 cs.AI 79%

Rewarding Structural Conformance of Reasoning using Process Mining

使用过程挖掘奖励推理的结构符合性

Yongjae Lee, Taekhyun Park, Sunghyun Sim, Hyerim Bae

机构 * Dept. of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Dept. of Data Science(数据科学系) Changwon National University(昌原国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TACReward奖励模型,利用过程挖掘技术聚合推理步骤的结构偏差,以改进稀疏奖励策略梯度方法在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14958 2026-05-26 cs.CL 79%

MUR: Momentum Uncertainty guided Reasoning for Large Language Models

MUR: 面向大型语言模型的动量不确定性引导推理

Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Luu Anh Tuan, Haiteng Zhao, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(Vin大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动量不确定性引导推理(MUR)方法,通过追踪和聚合逐步不确定性动态分配推理预算,并引入γ控制机制,在不额外训练的情况下减少冗余计算,在多个基准上平均减少45%以上计算量并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10201 2026-05-26 cs.LG cs.AI cs.CL 75%

Future-KL Regularized GRPO: Process-Level Credit Assignment from $f$-Divergence Regularization

未来KL正则化GRPO:基于f-散度正则化的过程级信用分配

Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出未来KL正则化策略优化(FRPO),通过因果未来正则化回报修正GRPO中局部KL损失缺失的梯度信号,在数学推理任务中提升pass@16并保持更高熵和更低策略漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25198 2026-05-26 cs.LG cs.AI 73%

Hide to Guide: Learning via Semantic Masking

隐藏以引导:通过语义掩码学习

Ruitao Liu, Qinghao Hu, Alex Hu, Yecheng Wu, Shang Yang, Luke J. Huang, Zhuoyang Zhang, Han Cai, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23914 2026-05-26 cs.DC cs.AI cs.MA 70%

VineLM: Trie-Based Fine-Grained Control for Agentic Workflows

VineLM: 基于Trie的细粒度控制用于智能体工作流

Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25698 2026-05-26 cs.LG cs.AI 62%

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度

Zhitao Zhu, Xili Wang, Shizhe Wu, Jiawei Fu, Xiaoqing Liu

机构 * Peking University(北京大学) Meituan(美团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25604 2026-05-26 cs.CL cs.LG 62%

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

DVAO: 面向多奖励强化学习的动态方差自适应优势优化

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对多奖励强化学习中奖励组合导致训练不稳定、优势组合依赖静态超参数的问题,提出动态方差自适应优势优化方法,通过基于经验奖励方差动态调整组合权重,实现稳定训练与多目标帕累托前沿优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25338 2026-05-26 cs.LG cs.AI 62%

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

CausalFlow: LLM Agent 失败的因果归因与反事实修复

Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CausalFlow框架,通过反事实干预计算步骤级因果责任分数,识别失败步骤并生成最小编辑修复,用于测试时修复和训练时监督,在多个基准上优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15620 2026-05-26 cs.CL cs.AI 62%

STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens

STAPO:通过抑制稀有虚假标记稳定大语言模型的强化学习

Shiqi Liu, Zeyu He, Guojian Zhan, Letian Tao, Zhilong Zheng, Jiang Wu, Yinuo Wang, Yang Guan, Kehua Sheng, Bo Zhang, Keqiang Li, Jingliang Duan, Shengbo Eben Li

机构 * School of Vehicle Mobility \& College of AI, Tsinghua University Didi Voyager Labs, DiDi Autonomous Driving

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对强化学习微调大语言模型时因稀有虚假标记导致训练不稳定和性能崩溃的问题,提出STAPO方法,通过抑制这些标记的梯度扰动,在多个数学推理基准上实现稳定训练和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08499 2026-05-26 cs.LG cs.AI 62%

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

上下文展开赌博机:面向可验证奖励的强化学习

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Huawei(华为)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中展开使用无差别、短视导致的问题,提出上下文赌博机框架,自适应选择高价值展开,提升训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25189 2026-05-26 cs.LG cs.CL 62%

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

方向对齐缓解语言模型强化学习中的奖励黑客问题

Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 通过分析强化学习更新的几何结构,发现奖励黑客源于优化偏离稳定低维学习轨迹,提出可信方向投影方法约束梯度在干净参考子空间内,延迟捷径利用并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24697 2026-05-26 cs.CL cs.AI 62%

The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models

路径很重要:学习扩散语言模型的令牌提交策略

Bohang Sun, Max Zhu, Francesco Caso, Jindong Gu, Junchi Yu, Philip Torr, Pietro Liò, Jialin Yu

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24168 2026-05-26 cs.AI cs.LG 62%

Inference Time Context Sparsity: Illusion or Opportunity?

推理时上下文稀疏性:幻觉还是机遇?

Sahil Joshi, Prithvi Dixit, Agniva Chowdhury, Anshumali Shrivastava, Joseph E. Gonzalez, Ion Stoica, Kumar Krishna Agrawal, Aditya Desai

机构 * Berkeley(伯克利)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证和理论证据论证,在长上下文LLM推理中采用极端但原则性的上下文维度稀疏性不仅是可行的,而且能显著加速处理(如H100上实现10倍加速),从而挑战了密集注意力机制的必要性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13088 2026-05-26 cs.LG cs.AI 62%

Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation

序列级奖励的组内学习设计条件:令牌梯度消除

Fei Ding, Yongkang Zhang, youwei wang, Zijian Zeng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型多步推理中稀疏终端奖励导致的信用分配问题,提出反事实比较框架和隐式行为策略优化(IBPO),通过轨迹差异近似替代决策,将稀疏奖励转化为步骤敏感信号,提升训练稳定性和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25381 2026-05-26 cs.LG 57%

Not only where, But when: Temporal Scheduling for RLVR

不仅在哪里,而且何时:RLVR 的时间调度

Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对强化学习可验证奖励(RLVR)中忽略策略行为异质性的问题,提出时间调度方法,通过动态调整信用分配标准来优化学习动态,实验表明该方法能提升训练稳定性和效率。

Comments Github: https://github.com/Jinghaoleven/RLVR-Schedule

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18396 2026-05-26 cs.CL 57%

River-LLM: Large Language Model Seamless Exit Based on KV Share

River-LLM:基于KV共享的大型语言模型无缝退出

Yingtao Shen, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对解码器-only架构中早期退出因KV缓存缺失导致的延迟和精度问题,提出无需训练的River-LLM框架,通过轻量级KV共享退出流实现令牌级无缝退出,并利用状态转移相似性预测KV误差指导退出决策,在数学推理和代码生成任务上获得1.53-2.16倍实际加速且保持高质量。

Comments Accepted to ACL 2026, 13pages, with appendix. Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏