Efficient Multi-round LLM Inference over Disaggregated Serving
高效多轮LLM推理的解耦服务
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
高效多轮LLM推理的解耦服务
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
通过潜在蒸馏探索大语言模型
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(人工智能通用基础理论国家重点实验室,BIGAI,北京,中国) ; School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海交通大学,上海,中国)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Exploratory Sampling方法,通过蒸馏模型引导生成过程,提升语义多样性与推理效率,在数学、科学和代码生成中表现优异。
Comments 25 pages, 5 figures. Accepted in ICML 2026
双智能体语言模型中继中的状态压缩:约束保留的封闭世界研究
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究双智能体LLM中继中交接压缩问题,比较无压缩、叙述性总结、JSON提取、基于嵌入的修剪四种交接条件,发现交接表示影响下游可行性,JSON提取可行性准确率最高达0.96,结构化可审计表示利于约束检查。
Comments 8 pages, 2 figures, 3 tables
将尝试矢量化:为基于LLM的生成检索在加速器上实现高效的受限解码
机构 * Yale University(耶鲁大学) ; Google DeepMind(谷歌DeepMind)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 STATIC通过矢量化技术实现高效受限解码,显著提升基于LLM的生成检索性能。
Comments KDD 2026 camera-ready
用于MIMO系统的基于大语言模型的语义感知数据辅助信道估计
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 针对MIMO系统,提出基于大语言模型的语义感知数据辅助信道估计框架,利用语义信息进行可靠符号选择与校正,采用两层机制,仿真表明该框架在归一化均方误差和误码率上优于传统方案,接近理想估计器性能。
高效利用大语言模型进行系统级测试代码的黑盒故障定位
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 本文提出一种无需执行测试用例的静态方法,利用大语言模型对系统级测试代码进行故障定位,通过修剪复杂测试代码减少推理时间,提升故障定位准确率。
Comments Accepted for publication at IEEE Transactions on Software Engineering (TSE) 2026, 33 pages. Link to Github repository: https://github.com/Ahmadreza-SY/TCFL
超越单维压缩:大语言模型的复合稀疏前沿
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型压缩,提出复合稀疏框架,结合静态参数剪枝和动态令牌级计算,通过低秩近似、通道剪枝及引入轻量级路由器实现。实验表明其在相同总稀疏度下优于单机制压缩,揭示跨维度干扰及有效分配方式,为改进压缩提供实用途径。
HACO:用于可靠大语言模型系统的套期保值代理计算
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。
GQLA: 面向硬件自适应的大语言模型解码的分组查询潜在注意力
机构 * Institute for Artificial Intelligence(人工智能研究院)
专题命中 效率与部署 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出GQLA,一种对MLA的极小修改,通过暴露MQA和GQA两种等价解码路径,使单一权重集在不同硬件(如H100和H20)上达到最优性能,并支持零冗余张量并行,同时通过TransGQLA将预训练GQA检查点转换为GQLA模型,显著压缩KV缓存。
FinRAG-12B:一家银行中基于事实的问题回答的生产验证配方
机构 * Kasisto ; Textualization ; NBME
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种高效框架,通过数据生成管道和校准拒绝机制,提升银行领域LLM的准确性与合规性,实现7.1个百分点的查询解决率提升。
Comments 7 pages, ACL 2026 conference
智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。
Comments This paper has been accepted by IEEE GLOBECOM 2026
加速动态边缘网络中的异构智能体协作
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 研究在动态边缘网络中加速异构智能体协作的问题,提出PRADA框架,通过将PRM作为离线教师,结合轻量级策略和拉格朗日调度器解决资源竞争,大幅降低延迟并保留LLM准确性,还揭示阈值效应,为资源配置提供指导。
InstantInfer:使用通信有限自动机实现快速大语言模型冷启动
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究大语言模型推理服务冷启动低效问题,提出通信有限自动机抽象及编程框架,经证明其正确性后应用于vLLM相关环节形成InstantInfer,大幅加速冷启动且在多场景表现鲁棒。
Comments 15 pages, 18 figures
打破MoE大语言模型三重困境:动态专家聚类与结构压缩
机构 * Guangzhou University(广州大学) ; Institue of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; ByteDance Inc.(字节跳动公司) ; University of Science and Technology Beijing(北京科技大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出动态专家聚类与结构压缩框架,通过参数分解和分层路由策略,显著提升MoE大语言模型的效率和内存利用率。
Comments 10 pages, 2 figures, 8 tables. Under review as a conference paper at ICML 2026
XWind: 面向可再生能源农场的跨站点大语言模型推理服务路由器
机构 * Microsoft(微软)
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI
AI总结 提出AI绿色围栏部署模式,并构建XWind路由器,利用实时信号动态配置站点和分发请求,以在可变风力供电下高效服务推理请求。
解码时语法:基于语法片段细化顺序的受限大语言模型生成
机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院) ; University of Leeds(利兹大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在低资源编程表面生成代码的问题,提出解码时语法方法,通过运行时环境实例化语法片段,经特定策略和算子确保语法语义正确,实现中在多种语言和模型上消除幽灵引用。
灰箱仿真模型的智能校准:一种由大语言模型驱动的替代方法
机构 * Catalan Institute of Oncology-IDIBELL(加泰罗尼亚肿瘤研究所-IDIBELL) ; Autonomous University of Barcelona(巴塞罗那自治大学) ; Centro de Investigación Biomédica en Red de Epidemiología y Salud Pública(国家公共卫生与流行病学网络生物医学研究中心) ; Artificial Intelligence Research Institute, IIIA-CSIC(人工智能研究所,西班牙科学研究委员会-人工智能研究所)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究灰箱仿真模型校准问题,提出用大语言模型作优化器的智能校准方法,在肛门癌仿真模型上评估,结果表明该方法在减少模型评估次数上有优势,虽迭代推理时间增加,但可审计和解释,适用于仿真时间占主导的情况。
Comments Manuscript: 19 pages, 2 figures. Appendix: 11 pages, 1 figure
压缩关键内容:神经元重要性与数据感知低秩近似用于语言模型压缩
机构 * Information Technologies Institute (ITI), Centre for Research and Technology HELLAS (CERTH)(信息技术研究所(ITI),希腊研究与技术中心(CERTH))
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 研究语言模型压缩问题,结合神经元重要性和数据感知低秩近似方法,提出动态压缩率分配算法,实验表明该方法在高压缩率下性能与或优于现有技术。
Journal ref EEE Access, vol. 14, pp. 6106-6120, 2026
野外的智能体:研究与部署的交汇点
机构 * Georgetown University(乔治敦大学) ; Salesforce(Salesforce公司) ; Bayer(拜耳公司) ; Bloomberg(彭博公司) ; Microsoft Research(微软研究院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。
AgentJet:一种用于智能体强化学习的灵活群体训练框架
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentJet,一种解耦的多节点群体训练框架,支持异构多模型强化学习、多任务鸡尾酒训练、容错执行和实时代码迭代,并通过上下文跟踪模块实现1.5-10倍训练加速。
Comments Technical report, 32 pages
DiffAxE:扩散驱动的硬件加速器生成与设计空间探索
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对硬件加速器设计空间探索难题,传统方法有局限。本文提出生成方法,将硬件设计建模为基于目标性能的一维图像合成,能有效学习相关映射,在降低生成误差、提升性能及加速搜索等方面有显著贡献。
Comments Accepted at ICCAD 2026
HERAKLES:用于开放式语言模型智能体的分层技能编译
机构 * Inria(Flowers)(Inria) ; University of Bordeaux(波尔多大学) ; Sorbonne Université (ISIR)(索邦大学) ; Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG
AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。
Comments 42 pages
用于跨语言立场检测的基于理由引导的知识蒸馏
机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Hefei Institute of Technology(合肥学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。
Comments 23 pages, 7 figures, 3 tables
自回归生成模型的随机热力学:非马尔可夫视角
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文从非马尔可夫视角出发,建立自回归生成模型的随机热力学框架,提出熵产概念,通过采样轨迹高效估计熵产,探讨了在大语言模型中的应用及非马尔可夫过程的不可逆性量化。
Comments 30 pages, 11 figures
超越准确性和成本:针对动态工作负载的延迟感知大语言模型查询路由
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软)
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 研究针对动态工作负载的大语言模型查询路由,设计轻量级延迟估计器,纳入延迟感知路由器,联合优化延迟、准确性和成本,实验表明该方法能在保持延迟的同时提升准确性 - 成本效用达40%。
AdaFlash:通过策略蒸馏扩散草稿器实现自适应推测解码
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Huawei Foundation Model Dept(华为基础模型部)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对扩散草稿器在推测解码中存在的问题,提出AdaFlash框架,包含基于策略蒸馏算法和自适应长度头,有效降低方差,实验证明该框架能提高推理速度,尤其在高并发场景中吞吐量显著提升。
自主性经济学:适用于可保险的人工智能驱动的6G系统的实时风险索引
机构 * German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心(DFKI)) ; RPTU University of Kaiserslautern-Landau, Germany(莱茵-威斯伐尔大学科堡分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究6G网络中传统治理框架在风险管理上的不足,提出GIRAF框架,通过机器可读运行时信号得出总风险指数,形式化验证陈旧性权衡,经模拟验证该框架能保持操作完整性并为多利益相关者责任归属等提供精算基线。
Comments Accepted at the IEEE 104th Vehicular Technology Conference - VTC2026-Fall
M-RAG:使RAG更快、更强和更高效
机构 * Southwestern University of Finance and Economics(西南财经大学) ; Zhida AI, Zhida Technology(智达AI,智达科技) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 M-RAG提出一种无片段检索策略,通过提取结构化元标记提升检索与生成效率,实验证明其在低资源环境下优于传统RAG方法。
RAPT:面向真实人类机器人的模型预测异常检测与故障诊断
机构 * School of Electrical Engineering and Computer Science, University of Queensland(电气工程与计算机科学学院,昆士兰大学) ; CSIRO Robotics, Data61(CSIRO机器人,Data61)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 RAPT通过模型预测异常检测和故障诊断技术,提升人形机器人在仿真到现实转移中的鲁棒性和可解释性。
在不断演变的领域上进行连续视频 - MLLM 适应
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Hong Kong Polytechnic University(香港理工大学) ; The University of Southern Queensland(南昆士兰大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。
Comments Accepted to ACM MM 2026