arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2605.05727 2026-06-11 cs.DC 版本更新 91%

LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing

LLM增强的深度强化学习用于协作边缘计算中的任务卸载

Hao Guo, Kaixiang Xu, Ziwu Ge, Lei Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LeDRL框架,结合轻量级LLM与自注意力增强DRL,通过结构化提示和语义反馈实现实时任务卸载,在成功率、收敛速度和实时性上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11145 2026-06-10 cs.CR 新提交 91%

OpenPCC: Open and Confidential LLM Serving on Commodity TEEs

OpenPCC:在商用TEE上提供开放且保密的LLM服务

Haoling Zhou, Shixuan Zhao, Chao Wang, Zhiqiang Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对云推理服务中用户请求包含敏感信息的问题,提出OpenPCC框架,利用商用TEE实现开放、保密的LLM服务,并通过原型验证其可行性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09061 2026-06-09 cs.DC cs.PF 新提交 91%

Fairness-Aware and Latency-Controllable Scheduling for Chunked-Prefill LLM Serving

面向分块预填充LLM服务的公平感知与延迟可控调度

Haoxin Liu, Jiayi Wang, Yueshen Xu, Rui Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对分块预填充LLM服务中的调度公平性与延迟稳定性问题,提出基于老化策略的动态优先级调度、延迟预测请求调度和主动预填充控制,在NVIDIA GPU和Ascend加速器上实验表明,相比FCFS,平均端到端延迟降低10%以上,P99尾延迟显著减少。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04415 2026-06-09 cs.DC 91%

FlexNPU: Transparent NPU Virtualization for Dynamic LLM Prefill-Decode Co-location

FlexNPU: 用于动态LLM预填充-解码共置的透明NPU虚拟化

Jiongjiong Gu, Jianfeng Wang, Zidong Han, Yongqiao Wang, Pengfei Xia, Mingjie Zhang, Hong Liu, Yuanyi Xia, Jiajia Chu, Yifeng Tang, Hui Zang, Xin Yao, Qijie Qiu, Yuzhao Wang, Chuanfei Xu, Lin Zhang, Zhuonan Lai, Hongming Huang, Jiawei Qiu, Gong Zhang, Weipeng Cao, Zhong Ming

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中预填充与解码阶段资源需求互补的问题,提出FlexNPU,一种透明用户空间虚拟化层,通过动态共置调度提升吞吐量并降低TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05511 2026-06-05 cs.ET 91%

RH+: Row-Hit-Optimized Scheduling for PIM-based LLM Inference

RH+:基于PIM的LLM推理的行命中优化调度

Yongchan Jung, Shafayat Mowla Anik, Byeong Kil Lee, Jeeho Ryoo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对PIM架构中LLM推理的GEMV操作,提出RH+调度通过改变步长使连续MAC操作在同一行,解决行周期瓶颈,实现8-12倍加速和74%以上能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02987 2026-06-05 cs.DC math.OC 91%

Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control

大规模LLM推理与异构工作负载:Prefill-Decode竞争及渐进最优控制

Ruihan Lin, Zezhen Ding, Zean Han, Jiheng Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了大规模LLM推理中异构工作负载下的Prefill-Decode竞争问题,提出了一种随机控制框架,通过多类多服务器队列网络模型,实现了渐进最优的资源分配与调度策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00365 2026-06-02 cs.AR 91%

SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference

SPARQLe: 用于量化LLM推理的子精度激活表示

Aradhana Mohan Parvathy, Soumendu Kumar Ghosh, Shamik Kundu, Arnab Raha, Souvik Kundu, Deepak A. Mathaikutty, Anand Raghunathan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理中激活值高精度需求导致的硬件开销,提出SPARQLe软硬件协同设计框架,利用激活值低位稀疏性,将高精度张量分解为密集低位和稀疏高位部分,在保持精度的同时降低内存访问和计算能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29639 2026-05-29 cs.OS 91%

RTP-LLM: High-Performance Alibaba LLM Inference Engine

RTP-LLM:高性能阿里巴巴大语言模型推理引擎

Boyu Tan, Jiarui Guo, Zongwei Lv, Hanbo Sun, Tong Yang, Kan Liu, Xinfei Shi, Zetao Hu, Yaxin Yu, Chi Zhang, Jianning Zhang, Xi Yang, Wei Zhang, Bo Cai, Silu Zhou, Xiyu Wang, Na He, Yinghao Yu, Wending Bao, Guiyang Huang, Yuxing Yuan, Juncheng Yin, Nan Wang, Lin Yang, Zechao Zhang, Lu Chen, Guoding Li, Tao Lan, Lin Qu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出RTP-LLM推理引擎,通过文件顺序驱动I/O、预填充-解码分离架构、分层多级KV缓存、模块化推测解码等技术,在工业规模部署中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25655 2026-05-26 cs.DC 91%

Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers

异构众核超级计算机上的带宽感知LLM推理

Yao Lu, Zhongzhi Luan, Gen Li, Jiaxing Qi, Shiqing Ma, Bin Han, Shizhe Shang, Hailong Yang, Depei Qian

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对异构众核处理器带宽瓶颈,提出硬件感知推理框架THInfer,通过软硬件协同设计和并行策略优化,在MT-3000处理器上实现高效LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25247 2026-05-26 cs.DC 91%

Kavier: Exploring Performance, Sustainability, and Efficiency of LLM Ecosystems under Inference through Cache-Aware Discrete-Event Simulation

Kavier:通过缓存感知离散事件模拟探索推理下LLM生态系统的性能、可持续性和效率

Radu Nicolae, Alexandru Iosup, Animesh Trivedi, Jesse Donkervliet

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出并验证了推理下LLM生态系统的参考架构,并设计了首个通过离散事件和缓存感知模拟预测LLM生态系统性能、可持续性和效率的仿真工具Kavier。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24832 2026-05-26 cs.DC 91%

Optimus: Elastic Decoding for Efficient Diffusion LLM Serving

Optimus: 用于高效扩散LLM服务的弹性解码

Chiyue Wei, Cong Guo, Bowen Duan, Junyao Zhang, Haoxuan Shan, Yifei Wang, Yangjie Zhou, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Optimus系统,通过动态调整解码粒度(分块解码与饱和度感知调度)来平衡GPU利用率和令牌效率,实现扩散LLM的弹性解码,显著提升吞吐量并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24022 2026-05-26 cs.AR cs.DC 91%

Adaptive KV Cache Reuse for Fast Long-Context LLM Serving

自适应KV缓存重用用于快速长上下文LLM服务

Fei li, Song Liu, Yan Liu, Jinhua Cui, Shiqiang Nie, Jinyu Wang, Weiguo Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对长上下文LLM推理中预填充阶段TTFT延迟瓶颈,提出CacheTune系统,通过频域分析识别关键KV对并选择性重计算,结合稀疏传输、异步重叠和硬件感知自适应重计算比调优,实现3.72x-4.86x TTFT加速和接近全重计算的生成质量。

Comments 14 pages, Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20191 2026-05-26 cs.LG cs.AI cs.CL 91%

MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM

MoBiQuant: 面向令牌自适应任意精度LLM的混合比特量化

Dongwei Wang, Jinhee Kim, Seokho Han, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, KhayTze Peong, Kang Eun Jeon, Jong Hwan Ko, Yiran Chen, Huanrui Yang

机构 * University of Arizona(亚利桑那大学) Duke University(杜克大学) Sungkyunkwan University(成均馆大学) Panasonic AI Lab(松下人工智能实验室) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对动态运行时约束下大语言模型任意精度量化的泛化性问题,提出基于令牌敏感度的混合比特量化框架MoBiQuant,通过多合一递归残差量化和令牌感知路由器实现灵活推理,在匹配或超越前沿单精度PTQ的同时显著节省内存并提升吞吐量。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 91%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16867 2026-05-19 cs.DC 91%

GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources

GoodServe: 向异构资源上实现高吞吐量的代理LLM推理服务

Boxiao Du, Boning Huangfu, Yizhou Luo, Chen Chen, Zijun Li, Minchen Yu, Xiaoyi Fan, Minyi Guo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GoodServe系统,通过预测和修正的方法优化异构资源上的代理LLM推理服务,提高吞吐量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18249 2026-05-19 cs.IR 91%

Dual-Tree LLM-Enhanced Negative Sampling for Implicit Collaborative Filtering

双树LLM增强的隐式协同过滤负采样

Jiayi Wu, Zhengyu Wu, Xunkai Li, Rong-Hua Li, Guoren Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出双树LLM增强负采样方法,通过无文本和无微调的结构化编码提升隐式协同过滤推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19179 2026-05-18 cs.DC 91%

CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing

CascadeInfer: 基于长度意识的LLM服务调度以实现低延迟和负载均衡

Yitao Yuan, Chenqi Zhao, Bohan Zhao, Zane Cao, Yongchao He, Wenfei Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 CascadeInfer通过动态调度请求降低LLM服务延迟和负载不均,提升系统吞吐量,减少端到端延迟达67%。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15601 2026-05-18 cs.DC cs.PF 91%

LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind

LMDeploy通过TurboMind加速混合精度LLM推理

Li Zhang, Youhe Jiang, Guoliang He, Xin Chen, Han Lv, Qian Yao, Ningsheng Ma, Fangcheng Fu, Kai Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 LMDeploy通过TurboMind实现高效混合精度LLM推理,通过通用化和高效的混合精度流水线优化矩阵运算和注意力计算,降低延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09894 2026-05-12 cs.SE cs.MA 91%

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

确定性与LLM控制的编译流程在COBOL到Python现代化中的对比

Naing Oo Lwin, Rajesh Kumar

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过实验对比确定性和LLM控制的编译流程,发现确定性方法在准确性、鲁棒性和效率上更优,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06052 2026-05-08 cs.AR 91%

XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA

XtraMAC:一种适用于FPGA上混合精度LLM推断的高效MAC架构

Feng Yu, Hongshi Tan, Yao Chen, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出XtraMAC架构,通过统一整数、浮点和混合精度运算,实现动态运算打包和高效资源共享,提升FPGA在混合精度LLM推断中的计算密度和能效。

Comments Accepted to ISCA 2026. 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05274 2026-05-08 cs.CR 91%

Sealing the Audit-Runtime Gap for LLM Skills

填补LLM技能的审计-运行时差距

Tingda Shen, Yebo Feng, Konglin Zhu, Xiaojun Jia, Yang Liu, Lin Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SIGIL框架,通过去中心化链上注册表和技能验证协议,实现LLM技能从发布到运行时的可验证绑定,有效抵御技能供应链攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 91%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00320 2026-05-04 cs.AR 91%

VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices

VitaLLM:一种 versatile 且 tiny 的混合精度 LLM 推理边缘设备加速器

Zi-Wei Lin, Tian-Sheuan Chang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 VitaLLM 通过 ternary 权重模型和高效计算核心,实现边缘设备上的高效混合精度 LLM 推理,减少 KV 通信并提升利用效率。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27384 2026-05-01 cs.AR 91%

RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write

RCW-CIM: 一种基于数字计算-in-内存的LLM加速器及读-计算/写架构

Yan-Cheng Guo, Tian-Sheuan Chang, Jian-Wei Su

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RCW-CIM架构,通过减少权重更新延迟和非线性操作融合,实现LLM加速,使Llama2-7B模型解码延迟降低21.59%,并提升能效。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26590 2026-04-30 cs.SE 91%

Recommendations for Efficient and Responsible LLM Adoption within Industrial Software Development

工业软件开发中高效负责任的LLM采用建议

Krishna Ronanki, Beatriz Cabrero-Daniel, Tomas Herda, Stefan Sitkovich, Jennifer Horkoff, Christian Berger

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出七条可行建议,旨在解决工业软件环境中高效且负责任地采用LLM的实践缺口,通过多案例研究和问卷调查验证了建议的相关性。

Comments Accepted for publication in the Information and Software Technology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21829 2026-04-28 cs.CR 91%

Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study

从专有LLM代理中黑盒技能窃取攻击:实证研究

Zihan Wang, Rui Zhang, Yu Liu, Chi Liu, Qingchuan Zhao, Hongwei Li, Guowen Xu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文实证研究了针对LLM代理系统的黑盒技能窃取攻击,发现技能窃取比传统提示窃取更具危害性,通过自动化攻击生成框架评估了商业代理平台和LLM,提出防御机制以降低技能泄露风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21399 2026-04-24 cs.DC cs.NI 91%

A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks

一种用于AI赋能Wi-Fi卸载网络中高效LLM推理的任务分解与规划框架

Mingqi Han, Xinghua Sun

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种用户-边缘协作框架,通过LLM规划器实现任务分解与子任务难度预测,优化多用户多边缘Wi-Fi网络中的子任务分配与执行,降低延迟并提升整体性能。

Comments 7 pages, 4 figures, conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20490 2026-04-23 cs.IR 91%

Break the Optimization Barrier of LLM-Enhanced Recommenders: A Theoretical Analysis and Practical Framework

突破LLM增强推荐系统优化障碍:理论分析与实践框架

Zhangchi Zhu, Wei Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过理论分析和实践框架,解决LLM增强推荐系统中优化障碍问题,提出TF-LLMER框架,通过嵌入规范化和Rec-PCA方法提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20553 2026-04-23 cs.SE 91%

DeepParse: Hybrid Log Parsing with LLM-Synthesized Regex Masks

DeepParse: 基于LLM合成的混合日志解析

Amir Shetaia, Sean Kauffman

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DeepParse,通过LLM提取日志变量模式并结合Drain算法实现高效准确的日志解析,提升提取精度与一致性,降低误报并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19241 2026-04-22 cs.DC 91%

UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training

UniEP:统一的专家并行MoE MegaKernel用于LLM训练

Size Zheng, Xuegui Zheng, Li-wen Chang, Jidong Zhai

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UniEP,通过统一专家并行优化策略,将MoE通信与计算融合为MegaKernel,实现自动化适应性调整,提升LLM训练效率并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏