arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22210 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22210 篇

2607.17175 2026-07-21 cs.DC 新提交 89%

LMEdge: QoS-Aware LLM Inference Orchestration on Edge Clusters

LMEdge:边缘集群上的QoS感知大语言模型推理编排

Reza Farahani, Zoha Azimi, Mario Colosi, Schahram Dustdar

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。

Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10186 2026-07-14 cs.AR 新提交 89%

FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01299 2026-07-14 cs.DC 版本更新 89%

HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching

HYPIC: 利用位置无关缓存加速混合注意力LLM服务

Yifei Liu, Juntong Wu, Yang Liu, Junhao Hu, Minghao Li, Xiaoxu Chen, Weihang Chen

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出Hypic系统,通过段累积转移算子和边界重计算,实现混合注意力LLM的位置无关缓存,显著降低首令牌延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23969 2026-07-13 cs.DC cs.CR cs.PF 新提交 89%

The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing

序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能

Hang Yin, Kevin Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04379 2026-07-07 cs.CR 新提交 89%

Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework

用于战场物联网任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架的知识库中毒攻击与防御

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究针对战场物联网任务控制的PA-LLM-RAG框架的对抗安全。提出查询无关语义检索中毒攻击,能注入规则致大语言模型上下文损坏。还提出CLD-KB防御框架,在检测中毒和知识保存方面性能优异。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00151 2026-07-02 cs.DC 新提交 89%

SmoothAgent: Efficient Long-Horizon LLM-Based Agent Serving with Lookahead Context Engineering

SmoothAgent: 基于前瞻上下文工程的高效长程LLM Agent服务

Zaifeng Pan, Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM Agent中上下文变换导致KV缓存失效和TTFT增加的问题,提出前瞻编程模型和调度器,实现异步上下文预处理,降低TTFT达11.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30980 2026-07-01 cs.HC 新提交 89%

Ethics and Social Responsibility in AI-Assisted Interviewing: An LLM-in-the-Loop Study of AI-Generated Follow-Up Questions

AI辅助访谈中的伦理与社会责任:基于LLM-in-the-loop的AI生成追问研究

He Zhang, Yueyan Liu, Xin Guan, Jie Cai, John M. Carroll

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过LLM-in-the-loop Wizard-of-Oz实验,研究AI实时生成追问在访谈中的应用,发现五大伦理问题:有害语言、尊重缺失、参与不平等、责任模糊及隐私风险,并提出设计与治理建议。

Comments This work has been accepted to CHIWORK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20653 2026-07-01 cs.SE cs.SY eess.SY 版本更新 89%

SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design

SysVCoder: 一种LLM驱动的系统级设计系统性生成框架

Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida, Zhenge Jia, Zhaoyan Shen, Mengying Zhao

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。

Comments This paper is accepted at APPT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30391 2026-06-30 cs.DC 89%

Energy-Aware Scheduling for Serverless LLM Serving on Shared GPUs

面向共享GPU的无服务器LLM服务的能量感知调度

Tianyu Wang, Gourav Rattihalli, Aditya Dhakal, Longfei Shangguan, Dejan Milojicic

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对无服务器LLM服务中多模型共享GPU带来的能耗优化难题,提出Festina系统,通过协同请求放置、SM分区和GPU工作点调整,在满足TTFT/TBT SLO前提下,实现集群能耗降低高达56%。

Comments 13 pages body and 5 pages appendix, 19 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29986 2026-06-30 cs.AR cs.DC 89%

HBM Is Not All You Need: Efficient Disaggregated LLM Serving across Memory-heterogeneous Accelerators

HBM并非唯一选择:跨内存异构加速器的高效分解式LLM服务

Zhixiang Wei, Yun Wang, James Yen, Mingyuan Xia, Zhengwei Qi

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理中预填充阶段HBM带宽闲置问题,提出HMA-Serve系统,通过分阶段量化、计算-传输流水线和延迟反量化,在GDDR加速器上高效执行预填充,实现3.2倍吞吐提升和4.8倍性价比提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27990 2026-06-29 cs.CR 新提交 89%

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

AdvancedShelLM:一种用于SSH欺骗的有状态多智能体LLM蜜罐

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出AdvancedShelLM蜜罐,采用多智能体多LLM架构,通过Manager和Worker两个LLM代理提升命令理解、减少错误响应并增强欺骗性,实现永久文件系统以支持多攻击者同时观察变化文件,评估显示高通过率和有效欺骗。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27665 2026-06-29 cs.SE 新提交 89%

LLM-Assisted Model-Based GUI Testing for Vue.js Web Applications

基于LLM辅助的Vue.js Web应用模型驱动GUI测试

Tao Li, Chenhui Cui, Rubing Huang, Dave Towey, Shikai Guo, Lei Ma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLMVue框架,利用大语言模型从Vue.js源码生成页面转换图,实现模型驱动GUI测试,在10个开源项目上验证了高精度和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25426 2026-06-25 cs.PF 新提交 89%

Above the Inner Loop: Exceeding Accelerate at LLM Prefill GEMM on the M1 AMX

在内循环之上:在M1 AMX上超越Accelerate的LLM预填充GEMM

Deyvik Bhan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过微基准测试发现M1 AMX的内循环受限于加载-发射,手写内核通过细粒度多线程面板和预打包权重两个部署级杠杆超越Accelerate,在12种LLM预填充GEMM形状上实现1.17倍到2.0倍的加速,且位精确。

Comments 11 pages, 2 figures, 6 tables. Code: https://github.com/dbhan08/inferc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29919 2026-06-25 cs.SE 版本更新 89%

SkillReducer: Optimizing LLM Agent Skills for Token Efficiency

SkillReducer: 优化LLM代理技能的令牌效率

Yudong Gao, Zongjie Li, Yuanyuan Yuan, Zimo Ji, Pingchuan Ma, Shuai Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21835 2026-06-24 cs.DC 版本更新 89%

Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices

基于卸载的流水线并行实现边缘设备上的协作无损LLM推理服务

Mingyu Sun, Xiao Zhang, Shen Qu, Yan Li, Mengbai Xiao, Yanwei Zheng, Yuan Yuan, Dongxiao Yu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出LOIP系统,通过卸载感知的交叉流水线并行、细粒度分配调度和在线内存自适应策略,在异构边缘设备上实现LLM无损推理,相比基线加速8.8-20.3倍。

Comments 12 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20847 2026-06-23 eess.IV cs.MM 新提交 89%

LLM-Driven Heuristic Frame-Level Quantization Parameter Adaptation for VVenC

基于LLM的启发式帧级量化参数自适应调整用于VVenC

Liqiang He, Yingwen Zhang, Riyu Lu, Meng Wang, Shiqi Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动设计帧级QP分配的率失真优化启发式,通过闭环进化框架迭代生成并评估候选算法,在VVenC上实现优于固定QP和拉格朗日基线的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22968 2026-06-23 cs.AR 新提交 89%

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference

MOCAP:面向晶圆级芯片的面向预填充LLM推理的内存协调分块流水线框架

Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MOCAP框架,通过内存平衡KV重分配和延迟平衡分块划分,解决晶圆级芯片上长上下文预填充中的内存和延迟不平衡问题,显著降低端到端延迟并提高吞吐量。

Comments 15 pages, 6 figures, accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22560 2026-06-23 cs.CR 新提交 89%

Evidence-Bound Gateway-Path Provenance for Third-Party LLM Inference

第三方LLM推理的证据绑定网关路径溯源

Fei Wang, Zebai Tian

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对第三方LLM网关中路由替换、隐藏回退等不可信问题,提出证据绑定架构,通过受信任执行环境分离控制面与执行面,实现可验证的路径溯源。

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22175 2026-06-23 cs.DC 新提交 89%

StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era

StickyInvoc:重新思考LLM时代高通量工作流的任务模型

Thanh Son Phung, Douglas Thain

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。

Comments arXiv admin note: substantial text overlap with arXiv:2510.14024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10907 2026-06-23 cs.NI cs.DC 89%

RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving

RouterWise: 多模型LLM服务中的联合资源分配与路由

Hossein Hosseini Kasnavieh, Gholamreza Haffari, Christopher Leckie, Adel N. Toosi

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对延迟敏感的多模型LLM服务,RouterWise通过联合资源分配与路由策略优化,提升输出质量并满足延迟目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22126 2026-06-23 cs.RO 版本更新 89%

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09003 2026-06-23 cs.DB 版本更新 89%

Orchestration for Domain-specific Edge-Cloud Language Models

面向特定领域的边缘-云端语言模型的编排

Prasoon Patidar, Alex Crown, Kevin Hsieh, Yifei Xu, Tusher Chakraborty, Ranveer Chandra, Yuvraj Agarwal

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出ECO-LLM系统,通过联合优化LLM服务流水线组件配置,在查询级别动态选择策略,在智能家居和智能汽车场景中相比GPT-4o准确率提升至90%,成本降低90%,延迟降低55%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18851 2026-06-18 eess.SY cs.SY 新提交 89%

From Tokens to Energy Flexibility: Quantization-Enabled Demand Response for Data Centers with LLM Inference Workloads

从令牌到能量灵活性:面向LLM推理工作负载的数据中心量化使能需求响应

Bojun Du, Xiaoyi Fan, Ershun Du, Long Chen, Jianpei Han, Qingchun Hou, Ning Zhang, Chongqing Kang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种量化使能的能量管理框架,通过建立量化-功率模型和两阶段需求响应模型,实现多园区协同优化,降低数据中心运营成本34.3%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18600 2026-06-18 cs.DC 新提交 89%

ShuntServe: Cost-Efficient LLM Serving on Heterogeneous Spot GPU Clusters

ShuntServe: 异构竞价型GPU集群上的成本高效LLM服务

Seungwoo Jeong, Moohyun Song, Juhyun Park, Kyungyong Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出ShuntServe系统,通过屋顶线模型估计性能和动态规划优化模型放置,在异构竞价型GPU集群上最大化吞吐量,结合输出保留迁移与共享张量存储实现容错,相比基线吞吐量提升1.42倍,成本效率提升31.9%以上。

Comments 18 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00161 2026-06-18 cs.LG cs.AI cs.CL quant-ph 版本更新 89%

LLM Compression by Block Removal with Constrained Binary Optimization

通过带约束二进制优化的块移除进行LLM压缩

David Jansen, Roman Rausch, Ali Hashemi, David Montero, Román Orús

机构 * Multiverse Computing(多维计算公司) Donostia International Physics Center(多斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出将大语言模型块移除压缩问题建模为约束二进制优化,映射到Ising玻璃系统,实现高效排序和高质量非连续块移除,在50%压缩时MMLU提升近23个百分点,且计算高效、通用性强。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17949 2026-06-17 cs.DC 新提交 89%

RouteBalance: Fused Model Routing and Load Balancing for Heterogeneous LLM Serving

RouteBalance: 面向异构LLM服务的融合模型路由与负载均衡

Wei Da, Evangelia Kalyvianaki

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出RouteBalance,通过融合模型路由与负载均衡为异构LLM服务实现质量、延迟和成本的三维联合优化,在13实例28GPU集群上达到最优前沿。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16264 2026-06-16 cs.DC 新提交 89%

Tropical: Enhancing SLO Attainment in Disaggregated LLM Serving via SLO-Aware Multiplexing

Tropical: 通过SLO感知的多路复用提升解聚式LLM服务中的SLO达成率

Jinming Ma, Jiefei Chen, Xiuhong Li, Jiangfei Duan, Haojie Duanmu, Xingcheng Zhang, Chao Yang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tropical系统,通过SLO感知的多路复用策略平衡排队时间和干扰,同时满足预填充和解码阶段的延迟约束,在真实数据集上相比现有系统提升高达2.09倍的请求数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18085 2026-06-12 cs.LG cs.AI cs.CL 版本更新 89%

Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs

构建未来:通过校准草稿图实现扩散LLM推测解码

Sudhanshu Agrawal, Risheek Garrepalli, Raghavv Goel, Christopher Lott, Fatih Porikli, Mingu Lee

机构 * University of Waterloo(多伦多大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Spiffy算法,利用校准的草稿图结构实现扩散LLM的推测解码,在保持输出分布的同时加速推理,最高减少8.6倍模型推理次数并加速6.3倍令牌生成速率。

Comments Original version uploaded on Sep 22, 2025. (v2): Extended Table 2 with additional analysis and referenced it in Sec 5.2. (v3): Added note to Sec 4.2 and Appendix A.2 specifying conditions for losslessness. (v4): Updated with the version accepted to ICML 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏