arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 876 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 162 篇

2605.09990 2026-05-12 cs.CL 90%

Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference

Merlin:用于无损上下文优化的大语言模型推理中的确定性字节精确去重

Sietse Schelpe

机构 * Corbenic AI, Inc.(Corbenic AI公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 Merlin通过高效去重和上下文优化提升大语言模型推理效率,减少冗余文本处理瓶颈,实验显示在高冗余数据中减少71%输入,保持数据完整性。

Comments Preprint. Implementation and open-source community version available at: https://github.com/corbenicai/merlin-community - https://doi.org/10.5281/zenodo.20090991

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08626 2026-05-12 eess.SP cs.DC cs.LG cs.MA 90%

Large Language Models over Networks: Collaborative Intelligence under Resource Constraints

网络上的大语言模型:在资源限制下的协作智能

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, H. Vincent Poor, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Princeton University(普林斯顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了在资源受限环境下,通过设备与云端协同以及多智能体协作提升大语言模型性能的方法,提出了协同推理的两种维度,并讨论了协作学习与开放研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04284 2026-05-12 cs.AI cs.LG 90%

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

Agent-Omit:适应性上下文省略以提高LLM代理效率

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science(香港科学与技术大学人工智能前沿) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Agent-Omit框架,通过省略冗余思考和观察提升LLM代理效率,实验表明其在多个基准测试中表现优异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09999 2026-05-12 cs.DC 90%

ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production

ServeGen:生产环境中大型语言模型服务的工作负载特征与生成

Yuxing Xiang, Xue Li, Kun Qian, Wenyuan Yu, Ennan Zhai, Xin Jin

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过深入分析真实世界中的大型语言模型服务工作负载,提出ServeGen框架,通过按客户端组合生成真实工作负载,有效避免了50%的欠配问题,提升了性能基准测试效果。

Comments 15 pages, NSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 90%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09702 2026-05-12 stat.ME cs.CL 90%

Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges

校准,而非筛选:从噪声LLM评判者中高效估计

Yanran Li

机构 * Department of Biostatistics(生物统计学系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了在噪声LLM评判者中如何通过校准而非筛选来提高估计效率,发现校准全组评判者优于基于准确率的筛选,且在多个基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13630 2026-05-12 cs.CR cs.AI 90%

SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment

SafeHarness:面向LLM代理部署的生命周期集成安全架构

Xixun Lin, Yang Liu, Yancheng Chen, Yongxuan Wu, Yucheng Ning, Yilong Liu, Nan Sun, Shun Zhang, Bin Chong, Chuan Zhou, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究所) Peking University(北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SafeHarness架构,通过四个防御层集成到代理生命周期中,解决现有安全方法的结构性不匹配问题,降低不安全行为和攻击成功率。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08636 2026-05-12 cs.CL 90%

EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints

EdgeFlowerTune: 在现实边缘系统约束下评估联邦大语言模型微调

Jiaxiang Geng, Yiyi Lu, Lunyu Zhao, Yan Gao, Nicholas D. Lane, Bing Luo

机构 * Duke Kunshan University(杜克-肯尼思大学) Flower Labs(Flower实验室) University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EdgeFlowerTune基准,评估联邦LLM微调在现实边缘系统中的可行性,通过联合评估模型质量和系统成本,包括通信、时延、内存使用、能耗和动态边缘条件鲁棒性,揭示仅凭准确率评估的局限性。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04738 2026-05-12 cs.LG 90%

OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

OSAQ: 用于准确低比特LLM量化中的异常自吸收

Zhikai Li, Zhen Dong, Xuewen Liu, Jing Zhang, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出OSAQ方法,通过利用Hessian的低秩特性,利用加法权重抑制技术有效抑制低比特量化中的异常,提升模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20012 2026-05-12 eess.SP cs.LG 90%

Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems

可靠的基于大语言模型的边缘-云-专家级联系统用于电信知识系统

Qiushuo Hou, Sangwoo Park, Matteo Zecchin, Yunlong Cai, Guanding Yu, Osvaldo Simeone, Tommaso Melodia

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院工程系智能信息处理系统中心) Intelligent Networked Systems Institute (INSI) at Northeastern University(东北大学智能网络化系统研究所)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种边缘-云-专家级联的LLM知识系统,通过问答流程实现决策,利用高效边缘模型处理常规查询,云模型处理复杂问题,必要时引入专家。通过统计严谨的阈值选择方法,保证在给定置信水平下可靠性。

Comments This paper has been submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08386 2026-05-12 cs.AI 90%

SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents

SkillLens: 适应性多粒度技能重用以实现成本高效的LLM代理

Yongliang Miao, Ziyang Yu, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SkillLens通过分层技能进化框架实现多粒度技能重用,解决技能重用中的相关性与成本矛盾,提升LLM代理在MuLocbench和ALFWorld中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08142 2026-05-12 cs.LG cs.CL cs.CV 90%

Reasoning emerges from constrained inference manifolds in large language models

推理源自大型语言模型中受限推断流形

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xiaoshuai Hao, Ji-Rong Wen, Jungong Han

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Xiaomi EV(小米电动车) Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中的内部表示演变,发现推理动态在高维空间中自组织为低维流形,但需满足表示能力、流形压缩和非退化信息体积等条件才能实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10440 2026-05-12 cs.CY 89%

TourMart: A Parametric Audit Instrument for Commission Steering in LLM Travel Agents

TourMart: 一种用于LLM旅行代理佣金管理的参数审计工具

Yao Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 TourMart通过参数lambda和kappa驱动反事实分析,区分LLM工程故障与真实商业引导,验证代理引导效果,输出合规报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07456 2026-05-12 cs.DC 89%

Agentic AI-Driven UAV Network Deployment: An LLM-Enhanced Exact Potential Game Approach

基于代理AI的无人机网络部署:一种增强型精确势博弈方法

Xin Tang, Xiaohuan Li, Qian Chen, Binhan Liao, Yaqi Zhang, Jianxin Chen, Changyuan Zhao, Junchuan Fan, Junxi Tian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于精确势博弈的无人机网络部署优化框架,结合代理AI与双重空间尺度算法,提升网络连接性与吞吐量,通过LLM自动生成效用权重以增强适应性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08065 2026-05-12 cs.LG cs.CL 88%

Deterministic Differentiable Structured Pruning for Large Language Models

确定性可微结构剪枝用于大语言模型

Weiyu Huang, Pengle Zhang, Xiaolu Zhang, Jun Zhou, Jun Zhu, Jianfei Chen

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出确定性可微剪枝方法,通过优化离散l0目标的确定性软替代,减少训练-测试不匹配并提升收敛速度,实验证明在大语言模型中实现高效剪枝。

Comments Published at ICML26;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05902 2026-05-12 cs.LG cs.AI 88%

CoreQ: Learning-Free Mismatch Correction and Successive Rounding for Quantization

CoreQ: 无学习的不匹配校正与连续舍入用于量化

Seohyeon Cha, Huancheng Chen, Dongjun Kim, Haoran Zhang, Kevin Chan, Gustavo de Veciana, Haris Vikalo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoreQ提出一种无学习的PTQ框架,通过几何分解得到闭式系数校正不匹配,减少过拟合并提升性能,适用于多种LLM场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11938 2026-05-12 cs.DC 88%

FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters

FlexPipe:通过片段化无服务器集群中的飞行管道重构实现动态LLM服务

Yanying Lin, Shijie Peng, Chengzhi Lu, Chengzhong Xu, Kejiang Ye

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 FlexPipe通过动态重构管道架构,解决无服务器集群中资源碎片化和请求模式变化带来的效率问题,实现8.5倍资源利用率提升和38.3%的延迟降低。

Comments EuroSys 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23928 2026-05-12 cs.CL 88%

The Astonishing Ability of Large Language Models to Parse Jabberwockified Language

大型语言模型解析jabberwockified语言的惊人能力

Gary Lupyan, Senyi Yang

机构 * Department of Psychology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校心理学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究展示大型语言模型能从严重退化的英文文本中恢复意义,通过替换内容词为无意义字符串的文本,模型能生成接近原文的常规英文,揭示了语法结构对词汇意义的强约束作用。

Comments Submitted to the 2026 Annual Meeting of the Cognitive Science Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09515 2026-05-12 cs.AI 88%

A Game Theoretic Free Energy Analysis of Higher Order Synergy in Attention Heads of Large Language Models

基于博弈自由能分析的大型语言模型注意力头中高阶协同效应

Djamel Bouchaffra

机构 * DAVID Lab, University of Paris-Saclay, UVSQ Campus, 78035 Versailles, France(巴黎萨克雷大学DAVID实验室,UVSQ校区,法国Versailles)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过博弈自由能原理分析大型语言模型注意力头中的高阶协同效应,揭示了高阶冗余性,并展示了通过剪枝降低计算成本的方法。

Comments this manuscript has been submitted to Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03829 2026-05-12 cs.CL cs.CR 88%

Majority Bit-Aware Watermarking For Large Language Models

多数位感知水印技术用于大语言模型

Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

机构 * University of Nevada, Reno(内华达大学里诺分校) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出多数位感知编码方法,通过放松绿色列表大小对水印信号强度的限制,提升大语言模型生成文本的解码准确性和文本质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10862 2026-05-12 cs.CL 87%

RUBEN: Rule-Based Explanations for Retrieval-Augmented LLM Systems

RUBEN:基于规则的检索增强大语言模型输出解释工具

Joel Rorseth, Parke Godfrey, Lukasz Golab, Divesh Srivastava, Jarek Szlichta

机构 * University of Waterloo(滑铁卢大学) York University(约克大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RUBEN通过新型剪枝策略发现最小规则集解释检索增强大语言模型输出,用于测试安全训练和对抗性提示注入效果。

Comments Accepted by ICDE 2026 (Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03688 2026-05-12 cs.AI 87%

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

TodyComm: 任务导向的多轮LLM多智能体系统动态通信

Wenzhe Fan, Tommaso Tognoli, Henry Peng Zou, Chunyu Miao, Yibo Wang, Xinhua Zhang

机构 * Department of Compute Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出TodyComm算法,通过策略梯度优化任务效用,生成适应动态的协作拓扑,实验证明其在动态对抗和通信预算约束下表现优异,具备高效、可扩展和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15686 2026-05-12 cs.LG 87%

Beyond Hard Writes and Rigid Preservation: Soft Recursive Least-Squares for Lifelong LLM Editing

超越硬写和刚性保存:用于终身LLM编辑的软递归最小二乘法

Xinyu Wang, Sicheng Lyu, Yu Gu, Jerry Huang, Peng Lu, Yufei Cui, Xiao-Wen Chang

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(蒙特利尔AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出RLSEdit,一种递归最小二乘编辑器,通过在线二次优化和软约束实现长期序列编辑,有效平衡编辑精度与稳定性,实验显示其在多个模型家族上稳定扩展至10000次编辑,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09931 2026-05-12 cs.CL cs.AI 87%

PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

PruneTIR: 在推理时工具调用剪枝以实现有效且高效的工具集成推理

Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudong Li, Shuhao Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology, China(北京理工大学计算机科学与技术学院) School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院) Independent, China(独立)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PruneTIR框架,通过剪枝轨迹、重采样工具调用和暂停工具使用,提升已有工具能力LLM的推理能力,减少工作上下文长度并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 87%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06374 2026-05-12 cs.DC 87%

ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism

ResiHP: 通过动态混合并行性缓解LLM训练故障

Tenghui Ma, Jihu Guo, Wei Gao, Sitian Lu, Zhisheng Ye, Hanjing Wang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 ResiHP通过动态调整并行组大小、模型分区和工作负载调度策略,提升混合并行训练的鲁棒性和效率,实验显示在不同故障场景下训练吞吐量提升1.04-4.39倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08962 2026-05-12 cs.DC 87%

MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production

MegaScale-Omni: 一种面向多模态大语言模型生产训练的超大规模、工作负载容错系统

Chunyu Xue, Yangrui Chen, Jianyu Jiang, Ningxin Zheng, Junda Feng, Jingji Chen, Shixiong Zhao, Shen Yan, Yi Lin, Lei Shi, Zanbo Wang, Lishu Luo, Faming Wu, Haibin Lin, Xin Liu, Yanghua Peng, Quan Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MegaScale-Omni系统,通过解耦并行策略、统一表示和负载平衡技术,提升多模态大语言模型在动态工作负载下的训练效率,实现1.27倍至7.57倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00539 2026-05-12 cs.CL cs.DC 86%

AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

AGoQ:激活与梯度量化用于低内存分布式训练大语言模型

Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

机构 * School of Computer Science(计算机科学学院) Technology, Harbin Institute of Technology, Shenzhen(技术学院,哈尔滨工业大学,深圳) Huawei Technologies Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 AGoQ通过层感知激活量化和梯度量化技术,实现近4位激活存储和8位梯度存储,降低内存使用并提升训练速度,实验表明在不同规模LLM上内存减少达52%,训练速度提升1.34倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10875 2026-05-12 cs.LG cs.CL 86%

Compute Where it Counts: Self Optimizing Language Models

在需要的地方计算:自优化语言模型

Yash Akhauri, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出自优化语言模型(SOL),通过轻量策略网络动态分配计算预算,提升解码效率与生成质量,在不同模型和计算条件下优于静态分配和随机搜索。

Comments Accepted at ICML'26 Code: https://github.com/akhauriyash/SOL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08134 2026-05-12 cs.LG cs.AI 86%

DARE: Diffusion Language Model Activation Reuse for Efficient Inference

DARE:扩散语言模型激活重用以提高推理效率

Natalia Frumkin, Bokun Wang, Hung-Yueh Chiang, Chi-Chih Chang, Mohamed S. Abdelfattah, Diana Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电子与计算机工程系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 DARE通过利用扩散语言模型中token级冗余性,提高推理效率,减少计算量,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏