arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2606.25442 2026-06-25 cs.CL 新提交 92%

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

PolicyAlign: 大型语言模型的直接基于策略的安全对齐

Chang Wu, Junfeng Fang, Houcheng Jiang, Kai Tang, Pengyu Cheng, Xiaoxi Jiang, Guanjun Jiang, Xiang Wang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出PolicyAlign框架,通过合成违规指令和策略敏感过滤,直接根据自然语言安全策略对齐LLM,提升安全性并保持低过度拒绝和通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23030 2026-06-23 cs.CL 新提交 92%

Have You Ever Seen Them? Entity-level Membership Inference through Interrogating Large Language Models

你见过它们吗?通过审问大型语言模型进行实体级成员推断

Yiran Zhu, Ziqi Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出实体级成员推断任务,通过语义特征分析从LLM生成文本中判断实体信息是否用于训练,形式化约束并设计五种审问策略,在人物实体上AUC达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 92%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15199 2026-06-16 cs.AI 新提交 92%

CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services

CogGuard:边缘智能服务中基于认知与操作画像的主动预警

Zhi Yao, Weihao Chen, Zhiqing Tang, Hanshuai Cui, Qianli Ma, Weijia Jia, Wei Zhao

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学) Guangdong Key Lab of AI and Multi-modal Data Processing(广东省人工智能与多模态数据处理重点实验室) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究院) Engineering Center of AI and Future Education(人工智能与未来教育工程中心) Guangdong Provincial Department of Science and Technology(广东省科学技术厅) Zhuhai Science-Tech Innovation Bureau(珠海市科技创新局) Beijing Normal University at Zhuhai(北京师范大学珠海校区)

专题命中 效率与部署 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出CogGuard框架,通过解耦离线LLM画像构建与在线SLM评分预测,结合前缀对齐KV缓存重用和长度感知分布式微调,实现边缘智能服务的主动预警,在教育和操作任务上降低构建时间48%、微调时间19%。

Comments Accepted to ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 92%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 92%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26491 2026-07-30 cs.AR cs.AI cs.ET cs.LG 新提交 92%

LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

LLMET:支持新兴M3D存储器的跨层评估以实现高能效LLM服务

Ming-Yen Lee, Hanchen Yang, Faaiq Waqar, Harsono Simka, Tushar Krishna, Muhammed Ahosan Ul Karim, Shimeng Yu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发跨层仿真框架LLMET,通过实验证实采用M3D技术扩展片上缓存可显著降低不同平台及场景下LLM服务的预填充、解码阶段能耗,为高能效LLM服务系统提供新方案。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02072 2026-07-07 cs.LG cs.AI cs.CR 新提交 92%

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

kNNGuard:将LLM隐藏激活转化为无需训练的可配置护栏

Mahmoud Abdelfattah, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) Mindgard

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出kNNGuard,一种利用现成LLM激活空间的无需训练护栏,通过多层kNN融合激活和嵌入空间分数,在多个领域达到与微调方法相当或更优的F1,且速度更快。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02460 2026-07-03 cs.LG cs.AI 新提交 92%

Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation

面向无标注LLM自蒸馏的神经元感知数据选择

Zhuowei Chen, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 效率与部署 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Neuron-OPSD框架,利用神经元激活指导训练数据选择和教师上下文构建,通过在线策略蒸馏实现无标注自蒸馏,提升领域内性能并保持跨领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25285 2026-06-25 cs.LG cs.AI 新提交 92%

EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression

EPTS:弹性后训练稀疏性用于高效大型语言模型压缩

Ke Xu, Jiaqi Wan, Wenhao Hu, Han Pu, Xiaoyun Wang

机构 * School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) School of Computer Science and Technology(计算机科学与技术学院) Tiangong University(天工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出弹性后训练稀疏性(EPTS)框架,通过单次优化生成单一弹性模型,支持多种稀疏度配置,解决传统方法需为每个稀疏度单独优化的效率问题。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 92%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19344 2026-06-19 cs.CL cs.AI 新提交 92%

Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation

揭示未言明之事:通过随机路径聚合可视化隐藏的LLM偏见

Matteo Pelossi, Rita Sevastjanova, Thilo Spinner, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TreeTracer工具,通过系统扰动分析、语法对齐聚合和分类感知节点合并,利用桑基图对比不同语义上下文,揭示LLM中隐藏的代表性和句法偏见。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17489 2026-06-17 cs.LG cs.AI 新提交 92%

Online LLM Selection via Constrained Bandits with Time-Varying Demand

基于时变需求的约束赌博机在线LLM选择

Yin Huang, Qingsong Liu, Jie Xu

机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校曼宁信息与计算机科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对边缘云推理系统中异构LLM的选择问题,提出一种基于置信界估计和需求预测的在线学习算法,在硬预算和软延迟约束下实现亚线性遗憾和约束违反。

Comments 11 pages, 3 figures with multiple subfigures, 1 table, submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16352 2026-06-16 cs.LG cs.AI 新提交 92%

Communication-Efficient Verifiable Attention for LLM Inference

面向LLM推理的高效通信可验证注意力机制

Ziqun Chen, Ming Wu, Michael Heinrich, Jason Zeng, Huiying Lan, Tianwei Zhang, Rui Tan

机构 * Nanyang Technological University(南洋理工大学) Zero Gravity Labs(零重力实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VeriAttn,通过将注意力计算卸载到GPU并由TEE验证,结合两阶段流水线和分区策略,显著降低TEE计算和通信开销,实现LLM推理加速。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09080 2026-06-09 cs.LG cs.CL 新提交 92%

Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy

超越FLOPs:基于GEMM中心分类法的LLM剪枝真实推理加速基准测试

Haozhe Hu, Hao Wu, Anhao Zhao, Longwei Ding, Peiran Yin, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习慕尼黑中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于GEMM维度的剪枝方法分类法,通过统一基准框架系统评估不同剪枝方法在加速-质量帕累托前沿上的表现,发现静态深度剪枝在低质量损失下最优,为LLM剪枝加速提供统一视角。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07098 2026-06-08 cs.CL cs.LG 新提交 92%

SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

SigmaScale: 基于SVD低秩分解和学习缩放矩阵的LLM压缩

Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

机构 * Department of Computer Science, Aalborg University Copenhagen(奥尔堡大学哥本哈根分校计算机科学系) MaLGa-DIBRIS, University of Genoa(热那亚大学MaLGa-DIBRIS) INFN, Sezione di Genova(国家核物理研究所热那亚分部) European Organization for Nuclear Research (CERN)(欧洲核子研究中心) Ceva, Inc.(Ceva公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SigmaScale方法,通过学习辅助缩放矩阵优化截断SVD的LLM压缩,降低权重矩阵有效秩,在Llama 3.1 8B和Qwen3-8B上达到竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13767 2026-08-17 cs.AI cs.RO 新提交 92%

Simulation-Aware In-Context Policy Improvement for LLM-Aided Analog Layout Refinement

面向LLM辅助的模拟电路版图优化的感知仿真上下文内策略改进

Bingyang Liu, Ziming Wei, Xiaohan Gao, David Z. Pan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM辅助模拟版图优化的样本效率问题,提出感知仿真的LLM多智能体框架,通过上下文内策略改进,仅需数十次仿真即可提升后版图性能,优于生成器启发式规则与贝叶斯优化方法。

Comments 7 pages, 3 figures. To appear in the Proceedings of the 2026 International Conference on LLM-Aided Design (ICLAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03812 2026-08-05 cs.CV 新提交 92%

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack:面向高效全模态大语言模型的统一令牌压缩方法

Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文针对全模态大语言模型的高计算开销问题,提出无需训练的OmniPack框架,通过LLM前结构压缩与LLM内语义优化的协作,在5个基准上实现最优性能-效率权衡,在Qwen2.5-Omni-7B上大幅降低计算量且保持高性能。

Comments 16 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01655 2026-08-04 cs.DC 新提交 92%

PrefixPlace: Provable Prefix Key-Value Placement for Large Language Model Serving under Heterogeneous Compute and Transfer Costs

PrefixPlace:异构计算与传输成本下大语言模型服务的可证明前缀键值放置方案

Zhiyu Wang, Rajkumar Buyya

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对异构计算与传输成本下LLM前缀KV放置的次优问题,提出PrefixPlace规划器,其性能接近最优且效率高,可提升RAG等场景的成本节省效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29136 2026-08-03 cs.CV 新提交 92%

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models

自监督点云编码器在高效3D大语言模型中的效能研究

Yao Zheng, Tian Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究探究低成本自监督点云编码器能否替代昂贵多模态编码器用于3D-LLM,经实验发现其与架构存在强交互,为高性价比3D-LLM设计提供指南。

Comments 14 pages, 3 figures. This work has been previously released as a preprint on ChinaXiv (No. ChinaXiv:202607.00167, DOI: 10.12074/202607.00167)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27918 2026-07-31 math.OC 新提交 92%

OptGraph: Large Language Models Enhanced Evolutionary Optimization Via Graph Retrieval-Augmented Generation

OptGraph:基于图检索增强生成的大语言模型增强进化优化

Xianchao Xiu, Jianhao Li, Huangyue Chen, Wanquan Liu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对现有LLM自动化进化优化的局限,提出引入GraphRAG的OptGraph工作流,通过类型化图复用经验等方法,在基准数据集上较现有框架平均精确准确率提升8.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15297 2026-07-20 eess.IV cs.MM 新提交 92%

Large Language Model-Enhanced Multi-hop Parallel Image Semantic Communication

大语言模型增强的多跳并行图像语义通信

Bingyan Xie, Jihong Park, Rui Mao, Longyu Zhou, Tianhao Liang, Yongpeng Wu, Wenjun Zhang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究提出LLM-MHPSC框架减轻多跳无线图像传输失真累积,设计粗到细残余压缩方案,开发LLM-RTO并提出自适应跳选择策略,实验表明其优于现有方案,为多跳语义通信应用提供灵活有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00511 2026-07-02 cs.SE 新提交 92%

Large Language Models for Multi-Lingual Equivalent Mutant Detection: An Extended Empirical Study

大型语言模型用于多语言等价变异检测:一项扩展的实证研究

Honglin Shu, Zhao Tian, Dong Wang, Junji Yu, Jiazhe Zhang, Xuejie Cao, Junjie Chen, Yasutaka Kamei

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文首次全面实证研究大型语言模型(LLMs)在等价变异检测(EMD)中的应用,使用Java和C变异对评估其性能,发现基于LLM的方法在F1分数上优于传统方法,且微调后的代码嵌入策略检测精度最高,同时展现出跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13573 2026-08-17 cs.AI 新提交 92%

A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

LLM 服务的一年:工作负载演变、缓存与负载均衡

William Nixon, Jon Durbin, Florian Standhartinger, Haryadi S. Gunawi, Juncheng Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过分析 Chutes 一年的 LLM 生产请求轨迹,揭示了 LLM 服务工作负载的演变规律与用户-模型结构,并将发布完整轨迹供后续研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10532 2026-08-12 cs.NI cs.LG 新提交 92%

Benchmarking LLM-Guided Control-Plane Policies for Backend Fault Isolation in HAProxy

对HAProxy中后端故障隔离的LLM引导控制平面策略进行基准测试

Aman Chauhan, Vishnu Pendyala

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文测试了不同规模和架构的LLM在HAProxy后端故障隔离中的策略效果,发现约3B有效参数的能力阈值,达标后可显著降低5xx错误,但会增加延迟与令牌开销,高效方案为阈值以上模型的非推理模式。

Comments 43 pages, 6 figures, 15 tables. Submitted to Journal of Network and Computer Applications (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09949 2026-08-12 cs.AI physics.bio-ph 新提交 92%

Closed-Loop LLM Co-Pilots for Digital Agriculture

面向数字农业的闭环大语言模型(LLM)协作副驾驶系统

Serge Kernbach

机构 * CYBRES GmbH(CYBRES有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发闭环LLM协作副驾驶系统,基于49通道植物传感器网络实现数字农业自主控制,通过三案例验证可缩短生产周期、降低能耗,提升成本价值比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06867 2026-08-10 cs.CL 新提交 92%

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学) University of Illinois Chicago(芝加哥伊利诺伊大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM路由器难以公平比较和扩展的问题,研究提出LLMRouter统一基础设施,构建含多类任务的基准xRouteBench,发现学习型路由器等的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 92%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02995 2026-08-05 cs.CR cs.AI 新提交 92%

SparSEEty: Extracting Tokens from Sparsity-Exploiting LLM Serving Systems via Deterministic Side Channels

SparSEEty:通过确定性侧信道从利用稀疏性的大语言模型(LLM)服务系统中提取 token

Yongwan Jo, Jinyoung Park, Euihyun Lee, Dokyung Song

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SparSEEty 是一种针对利用稀疏性的 LLM 服务系统的 token 提取攻击,通过 CVM 侧信道构建预言机、降低监控开销并反转激活轨迹,可高准确率重建 token,监控开销仅 3.7%-7.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26571 2026-07-30 cs.LG cs.SE 新提交 92%

From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

从Token到瓦时:现代GPU上大语言模型(LLM)推理的分析式能耗估算

Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis, George Dasoulas, Michael Keckeisen, Konstantinos Skianis, Sotirios Kotsopoulos, Francesca Dominici

机构 * National Technical University of Athens(雅典国家技术大学) Harvard University(哈佛大学) TWT GmbH Science & Innovation(TWT有限责任公司科学与创新部) NIKI Ltd Digital Engineering(尼基数字工程有限公司) University of Ioannina(约阿尼纳大学) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出一种无需直接测量的GPU级LLM推理能耗分析估算方法,适用于模型比较、绿色编码分析及设计时评估。

Comments 20 pages, 3 figures, 6 tables. Accepted for oral presentation at the GREEN-AI Workshop, co-located with ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏