arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22188 篇

2604.05150 2026-08-03 cs.SE cs.AI 版本更新 90%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28268 2026-07-31 cs.AI 新提交 90%

LLM-Guided Evolutionary Search for Constraint Model Reformulation to Improve Solver Efficiency

基于大语言模型引导的进化搜索的约束模型重构以提升求解器效率

Kostis Michailidis, Dimos Tsouros, Nguyen Dang, Tias Guns

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LLM引导的进化框架,引入PDR策略保留多样化上下文,在8个CSPLib问题上验证迭代重构可提升求解速度,且多样化上下文策略和验证选择均能增强加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27744 2026-07-31 cs.AI 版本更新 90%

A Policy-Driven Runtime Layer for Agentic LLM Serving

一种面向智能体LLM服务的策略驱动运行时层

Rui Zhang, Chaeeun Kim, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多智能体LLM系统中跨层策略难以高效实现的问题,提出在框架与引擎之间插入智能体运行时层,通过四个原语支持任意智能体感知策略,并在KV缓存策略CacheSage上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27090 2026-07-30 cs.DC cs.LG 新提交 90%

InferScale: GPU-Native KV Injection for Personalized LLM Serving

InferScale:面向个性化大语言模型服务的原生GPU KV注入方案

Peter Li, Prashant Pandey

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 InferScale是原生GPU的LLM内存系统,通过可复用KV状态替代重复提示词预填充,引入Chunked RoPE与上下文窗口编码,在LoCoMo数据集上显著降低TTFT、提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26967 2026-07-30 cs.CL 新提交 90%

Generation or Judgement? A Paradigm Perspective on LLM-Based Emotion-Cause Pair Extraction in Conversation

生成还是判断?基于范式视角的对话中基于大语言模型(LLM)的情感-原因对抽取

Weijie Feng, Hongchuang Wang, Binbin Liu, Zhiyong Cheng

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对对话情感-原因对抽取,对比LLM的生成与判断范式,发现对级判断更优,引入辅助检索器后在三个数据集上实现F1提升,明确任务分解与候选范围的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26631 2026-07-30 cs.LG cs.IR 新提交 90%

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Curtin University(科廷大学) Colorado State University(科罗拉多州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。

Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06256 2026-07-30 cs.AI 版本更新 90%

RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

RedKnot: 基于头部感知的KV重用和SegPagedAttention的高效长上下文LLM服务

Yang Liu, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Ruozhou He, Boyu Wang, Guanjie Chen, Tao Xie, Junhao Hu

机构 * Xiaohongshu Inc., China(小红书公司,中国) Peking University(北京大学) Huawei Cloud(华为云)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RedKnot系统,通过按KV头分解缓存并采用SegPagedAttention,实现位置无关的KV重用、前缀压缩、冷热分离和分布式放置,在不重训练模型的情况下提升资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新 90%

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20483 2026-07-24 cs.AI 新提交 90%

Tractable Hierarchical Control of Autoregressive Language Models

自回归语言模型的可处理分层控制

Max Scribner, Antonio Vergari, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究如何约束自回归大语言模型生成,核心方法是将其提炼为可处理概率模型,利用有限时长$LR(k)$文法可多项式时间计算满足情况的特性,实现对LLM生成的有效约束与引导,确保输出满足形式句法约束。

Comments 21 pages, 4 figures, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新 90%

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19490 2026-07-23 cs.CR cs.AI 新提交 90%

Integrity of peer-to-peer distributed LLM inference under malicious nodes

恶意节点下对等分布式大语言模型推理的完整性

Mert Cihangiroglu, Antonino Nocera

机构 * DCALab, Department of Electrical, Computer and Biomedical Engineering, University of Pavia, Italy(DCALab,电气、计算机与生物医学工程系,帕维亚大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究对等分布式LLM推理在恶意节点下的完整性问题,提出通过测量节点激活值变化检查输出完整性的方法,即混入秘密金丝雀输入,利用与已知参考的偏差识别恶意节点,实验中检测器AUROC达1.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17715 2026-07-21 cs.CL 新提交 90%

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用

Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。

Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 90%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08774 2026-07-13 cs.AI cs.HC 新提交 90%

CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions

CogniConsole:将推理时控制作为可靠大语言模型交互的形式化抽象进行外化

Vanessa Figueiredo, Wilter Franceschi

机构 * University of Regina(里贾纳大学) Orbital Sea(轨道海)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究挑战大语言模型可靠性仅取决于模型能力的观点,引入CogniConsole将推理时控制外化为结构化接口,通过489个探针实验表明增加结构支架可降低输出方差和故障率,为LLM系统设计评估开辟新方向。

Comments Revised version focusing on the CogniConsole system architecture and empirical evaluation of inference-time control probes (N=489)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 90%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02043 2026-07-03 cs.DC cs.AI 新提交 90%

Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

面向负载感知的预填充偏转用于分离式LLM服务

Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出一种主动预填充偏转调度器,通过将预填充作为分块步骤在解码节点上交错执行,消除节点间KV传输,显著降低P95 TTFT并提高SLO达标率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01601 2026-07-03 cs.AI 新提交 90%

SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication

SemHash-LLM:一种用于文档去重的多粒度语义哈希框架

Xinyi Fang, Kejian Tong, Jiabei Liu, Tao Ning, Yuhang He

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出多粒度语义哈希框架SemHash-LLM,融合语义投影哈希、注意力加权MinHash、对比边界学习和选择性LLM裁决,实现高效的大规模文档去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11357 2026-07-03 cs.DC cs.AI cs.AR cs.PF 新提交 90%

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

TileFuse:用于AMD NPU上高效量化LLM推理的融合混合精度内核库

Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对边缘NPU上量化LLM部署困难,提出TileFuse库,通过融合解包、反量化与GEMM/GEMV内核,并设计交错预分块布局与数据流,在XDNA2上实现AWQ格式原生支持,性能提升最高281%,能耗降低64.6%。

Comments 13 pages excluding reference, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14331 2026-07-03 cs.LG 版本更新 90%

LLM Priors for ERM over Programs

程序上经验风险最小化的LLM先验

Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

机构 * LLM Priors for ERM over Programs(LLM 优先级用于程序上的经验风险最小化)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出LLM-PV方法,利用预训练LLM作为先验,通过提议-验证机制实现程序类上的ERM选择,无需穷举枚举,在算法任务上从少量样本恢复规则并泛化到更长序列。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09735 2026-07-01 cs.AR cs.AI cs.DC cs.OS 版本更新 90%

KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving

KV-RM:为静态图LLM服务正则化KV缓存移动

Zhiqing Zhong, Zhijing Ye, Jian Zhang, Weijian Zheng, Bolun Sun, Xiaodong Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Argonne National Laboratory(阿贡国家实验室) Northwestern University(西北大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出KV-RM,通过正则化KV缓存移动提升静态图LLM服务的灵活性,减少内存占用并降低延迟峰值。

Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19453 2026-07-01 cs.CL cs.GT 版本更新 90%

Beyond Scalar Rewards: Dense Feedback for LLM Policy Synthesis in Sequential Social Dilemmas

超越标量奖励:面向序列社会困境的LLM策略合成中的密集反馈

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi AI技术公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究通过反馈工程,比较稀疏奖励与密集社会指标反馈对LLM在多智能体环境中生成程序化策略的影响,发现密集反馈能打破奖励别名,提升策略性能。

Comments Accepted to NExT-Game 2026: New Frontiers in Game-Theoretic Learning, ICML 2026 Workshop. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23088 2026-07-01 cs.CR cs.AI 版本更新 90%

From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching

从相似性到脆弱性:LLM语义缓存的密钥碰撞攻击

Zhixiang Zhang, Zesen Liu, Yuchong Xie, Quanfeng Huang, Dongdong She

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出语义缓存存在密钥碰撞攻击风险,通过CacheAttack框架在黑盒条件下实现86%的LLM响应劫持命中率,并能在不同嵌入模型间迁移,威胁智能体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03339 2026-06-30 cs.CY cs.AR cs.CL cs.HC 90%

Arapai: An Offline-First LLM Architecture for Adaptive Learning in Low-Connectivity Environments

面向低连接环境的离线优先LLM架构:用于自适应学习

Joseph Walusimbi, Ann Move Oguti, Joshua Benjamin Ssentongo, Keith Ainebyona

机构 * University of Nairobi(内罗毕大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种离线优先的LLM架构,适用于低连接环境中的自适应学习,通过本地推理和硬件感知模型选择,提供课程对齐的解释和结构化学术支持,适应不同教育阶段的学习者需求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26595 2026-06-26 cs.AI 新提交 90%

LLM-based Models for Detecting Emerging Topics in Service Feedback

基于LLM的服务反馈中新兴主题检测模型

Mahsa Tavakoli, Ruth Bankey, Cristián Bravo

机构 * Department of Statistical and Actuarial Sciences, The University of Western Ontario(西安大略大学统计与精算科学系) Canada Revenue Agency(加拿大税务局)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型、统计技术和人机协作的方法,用于检测服务反馈中的新兴质量主题,并揭示潜在服务不公,经税务专家评估优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 90%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24467 2026-06-24 cs.AI 新提交 90%

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

CompressKV: 面向资源高效长上下文LLM推理的语义检索引导KV缓存压缩

Xiaolin Lin, Jingcun Wang, Olga Kondrateva, Yiyu Shi, Bing Li, Grace Li Zhang

机构 * Technical University of Darmstadt(达姆施塔特工业大学) University of Notre Dame(圣母大学) Technical University of Ilmenau(伊尔梅瑙工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CompressKV框架,通过识别语义检索头(SRH)选择关键token并分层分配缓存预算,在仅用3% KV缓存时保留97%以上性能。

Comments arXiv admin note: substantial text overlap with arXiv:2508.02401

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23521 2026-06-23 cs.DC cs.LG 新提交 90%

Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference

Concordia: 用于容错LLM推理的即时编译持久内核检查点

Yuhang Gan, Yiwei Yang, Yuyi Li, Xiangyu Gao, Yichen Wang, Rain Jiang, Xiaoning Ding, Andi Quinn, Chen Qian

机构 * University of California Santa Cruz(加州大学圣克ruz分校) University of California, Davis(加州大学戴维斯分校) University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中GPU状态丢失问题,提出Concordia运行时,利用设备驻留持久内核实现JIT编译的增量检查点,支持PTX/SASS级插桩,无需修改应用代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 90%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交 90%

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20577 2026-06-23 cs.NI cs.AI cs.DC 新提交 90%

Human-Less LLM Serving: Quantifying the Human Tax on Throughput

无人类交互的LLM服务:量化吞吐量中的人类税

Jianhui Lian, Li Chen, Dan Li, Yong Jiang

机构 * Tsinghua SIGS(清华大学SIGS) Beijing Zhongguancun Laboratory(北京中关村实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过系统测量发现,为满足人类感知延迟的SLO(TTFT和TPOT),LLM服务系统在长上下文场景下牺牲了60-93%的吞吐量,并提出无人类交互服务模式以消除这一开销。

Comments 10 pages, 2 figures, 1 table. Preliminary work

详情

展开后加载摘要…

URL PDF HTML 收藏