arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3220 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2510.00192 2026-07-30 cs.LG cs.AI 版本更新 62%

Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation

大模型训练,紧凑部署:用于紧凑低秩适配的结构化压缩

Xin Yu, Cong Xie, Xunmei Liu, Tiantian Fan, Lingzhou Xue, Zhi Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LoRA表征能力不足的问题,提出PrunedLoRA框架,通过动态结构化剪枝实现自适应秩分配,在多项微调任务中性能优于LoRA及其变体和现有结构化剪枝方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24555 2026-07-28 cs.LG cs.AI 新提交 62%

LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding

LOCKS:用于高效长上下文解码的页面局部紧凑键摘要

Junsung Hwang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对长上下文解码中KV缓存瓶颈问题,提出LOCKS方法,为页面提供局部紧凑键摘要,通过重建对数its、估计注意力质量等操作,仅关注顶部页面,在多种任务中表现出色,显著降低解码延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18955 2026-07-28 cs.LG cs.CL 版本更新 62%

H$^2$SD: Hybrid Hindsight Self-Distillation

H$^2$SD:混合事后自蒸馏

Qiye Cai, Yichuan Ma, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Linyang Li, Xiaocheng Feng, Bing Qin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对强化学习中奖励监督问题,提出 H$^2$SD 混合事后自蒸馏框架。成功轨迹用教师概率调更新幅度,失败轨迹基于参考提示调整教师并最小化反向 KL 散度,实验表明该框架优于基线,能稳定优化且效率良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30789 2026-07-27 cs.LG cs.AI 版本更新 62%

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

小型模型是GRPO中策略级多样性的自然探索者

Yiran Xu, Yiming Ren, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang, Tianhe Wu, Junjie Wang, Yujiu Yang, Yu Qiao, Ruihang Chu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27618 2026-07-27 cs.AI cs.CY cs.HC cs.LG cs.SI 版本更新 62%

Math Education Digital Shadows for Investigating Learning with GenAI: Mathematics Performance, Anxiety, and Confidence in LLMs

数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现

Naomi Esposito, Anthony Tricarico, Luisa Porzio, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20433 2026-07-24 cs.CL cs.AI 新提交 62%

Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing

莫尔:让模型为稳健的跨域知识编辑指引自身方向

Jea Kwon, Jiwon Kim, Dong-kyum Kim, Meeyoung Cha

机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03472 2026-07-23 cs.CL cs.AI 版本更新 62%

Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution

词汇丢弃:LLM共同进化中的课程多样性

Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM共同进化中问题多样性崩溃的问题,提出词汇丢弃机制,通过在策略训练和课程生成时随机掩码输出logits维持多样性,在数学推理任务上提升求解器性能平均+4.4点。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 62%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新 62%

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04344 2026-07-21 cs.LG cs.AI 版本更新 62%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05969 2026-07-21 cs.CL cs.AI 版本更新 62%

Probing the Difficulty Perception Mechanism of Large Language Models

探究大语言模型的难度感知机制

Sunbowen Lee, Qingyu Yin, Chak Tou Leong, Jialiang Zhang, Yicheng Gong, Shiwen Ni, Min Yang, Xiaoyu Shen

机构 * Institute of Digital Twin, EIT(数字孪生研究所,EIT) Wuhan University of Science and Technology(武汉科技大学) Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院,中国科学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型内部评估问题难度的能力,通过线性探测和定位特定注意力头实现难度感知建模,经消融实验验证,为用LLMs作自动难度注释器提供支持,揭示token级差异,表明难度感知有结构组织,提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14506 2026-07-17 cs.LG cs.AI 新提交 62%

Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习的非空泛化界限

Yuxuan Zhu, Rohan Alur, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) MIT(麻省理工学院) Bridgewater AIA Labs(布里奇沃特人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14105 2026-07-17 cs.CL cs.AI 新提交 62%

Automatically Evolving Prompt Guidelines for Task-Specific Optimization

自动演化特定任务优化的提示指南

Cedric Richter, Salah Ghamizi, Mike Papadakis

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型提示指南优化问题,提出AGOPS方法,利用现有任务示例隐含信息,通过优化方案自动演化特定任务指南,提升下游任务性能,弥补提示不明确导致的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13394 2026-07-16 cs.CL cs.LG 新提交 62%

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL:将分布匹配强化学习扩展到大型语言模型

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在将GFlowNet风格的RL扩展到大型语言模型,提出GFlowRL算法,去除辅助分区网络,用批内蒙特卡罗估计替代学习的分区函数,并通过两个稳定器实现奖励分布匹配,在多个基准测试中表现出色,能稳定扩展到不同架构。

Comments 31 pages, 8 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 62%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11052 2026-07-14 cs.LG cs.CL 新提交 62%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交 62%

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17932 2026-07-14 cs.CL cs.AI 版本更新 62%

Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

在扩散大型语言模型中进行提示压缩:在LLDA上评估LLMLingua-2

Sterling Huang, Abigayle Brown, Jiyoo Noh, Jiakang Xu, Wantong Huo, Kaung Myat Kyaw, Jonathan Chan

机构 * University of Toronto(多伦多大学) King Mongkut’s University of Technology Thonburi(泰国科技理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提示压缩在扩散大型语言模型中的有效性,通过在LLDA上评估LLMLingua-2,发现提示压缩在数学推理任务中效果不佳,而摘要任务相对稳健,表明为扩散模型设计的提示压缩方法并不适用于所有场景。

Comments Accepted to appear in The 14th International Conference on Advances in Information Technology (IAIT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07372 2026-07-14 cs.CL cs.AI 版本更新 62%

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07066 2026-07-09 cs.LG cs.AI math.NT math.RT 新提交 62%

Multiplication Beyond Groups: Stratified Fourier Mechanisms in Transformer Circuits

超越群的乘法:Transformer电路中的分层傅里叶机制

Zitong Andrew Chen, Junaid Hasan, Akhil Srinivasan, Hemkesh Bandi, Jarod Alper

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究小型变压器学习复合模上模整数乘法的方法,提出幺半群扩展,将输入空间划分区域,发现训练的变压器中嵌入、注意力等呈现特定特性,表明相关表示理论机制可超越群扩展到更一般结构。

Comments 29 pages, 15 figures. Spotlight at the Mechanistic Interpretability Workshop at ICML 2026. First three authors contributed equally. Code at https://github.com/uw-math-ai/interpreting-monoids

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08048 2026-07-08 cs.CL cs.LG cs.PF 新提交 62%

Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge

通过专家乘积桥接的扩散语言模型并行解码

Juntong Shi, Brian L. Trippe, Jure Leskovec, Stefano Ermon, Minkai Xu

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出PoE-Bridge框架,通过专家乘积构建中间分布,结合扩散语言模型并行解码和自回归模型质量,实现5倍加速并恢复至少95%的AR性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05339 2026-07-07 cs.LG cs.AI stat.ML 新提交 62%

TREK: Distill to Explore, Reinforce to Refine

TREK:蒸馏以探索,强化以优化

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在学生策略覆盖外的难提示样本上失效问题,提出TREK方法,通过蒸馏扩展探索空间再结合GRPO优化,在多推理与智能体任务上大幅提升模型性能。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 62%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31648 2026-07-01 cs.AI cs.LG 新提交 62%

Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents

用英语思考,用韩语回答:多语言工具使用智能体的高效适配

Utsav Garg, Sungjin Hong, Jason Jung, Justin Lee, Shaan Desai, Joon Hee Kim, Anirudh Shrinivason, Edmond Wen, Susie Park

机构 * Cohere LG CNS

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出LuckyStar 111B混合推理模型,通过多语言监督微调、可验证奖励强化学习、语言一致性奖励和4-bit量化,高效适配多语言工具使用智能体,提升数学推理、函数调用和NL2SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28831 2026-06-30 cs.LG cs.AI 62%

HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

HARD-KV: 面向解码时KV压缩的头自适应正则化

Yuxuan Yang, Feiyang Ren, Bowen Zeng, Dalin Zhang, Jinpeng Chen, Gang Chen, Huan Li

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出HARD-KV框架,通过级联缓存层次和对数校准机制,解决头自适应压缩算法与静态内存模式的不匹配,实现高效长上下文推理。

Comments 25 pages, ICML 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-06-30 cs.MA cs.AI cs.LG 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18874 2026-06-29 cs.LG cs.CL 版本更新 62%

Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting

在做中保留:在线策略数据在缓解遗忘中的作用

Howard Chen, Noam Razin, Karthik Narasimhan, Danqi Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文系统比较了监督微调(SFT)和强化学习(RL)在语言模型后训练中的遗忘模式,发现RL因使用在线策略数据而更少遗忘,并验证了在线策略数据是缓解遗忘的关键因素。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03243 2026-06-29 cs.LG cs.AI cs.DC cs.PF 版本更新 62%

Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

先排序后服务:通过成对学习排序实现低延迟LLM服务

Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PARS调度器,通过成对排序预测任务响应长度,近似最短作业优先调度,减少队头阻塞,在vLLM上实现高达15.7倍延迟降低。

Comments 13 pages, 4 figures. Published in ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference), Hamburg, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏