Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
Comments 16 pages, 5 figures, and 9 tables. To appear at AAAI 2024
Journal ref AAAI 2024
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments revise according to peer review
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
CoRun:填充对于确定性大语言模型(LLM)推理而言简单且高效
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 CoRun利用LLM内核的位置不变性,通过独立预填充和固定形状批量解码的调度系统,在保证确定性推理的同时提升了LLM的吞吐量并降低了延迟。
Comments 13 pages, 14 figures
NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code
TokenStack:一种异构HBM-PIM架构和运行时,用于高效的LLM推理
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 TokenStack通过异构HBM-PIM架构优化KV缓存,提升LLM推理效率,实现1.62倍吞吐量和1.70倍服务能力提升,同时降低能耗30-47%。
SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。
Journal ref ICML 2026
我们撰写理论的方式会改变大语言模型(LLM)据此构建的程序吗?一项针对LLM理论转程序翻译中渲染器格式的前瞻性随机研究
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 该研究通过前瞻性随机实验发现,LLM理论转程序翻译中渲染器格式未产生预测的行为几何,为该领域规范格式效应设定了边界并提供了可审计研究工具。
Comments 112 pages, 2 figures; includes supplementary material and five reproducibility annexes. Data: https://doi.org/10.5281/zenodo.21876518. Software: https://doi.org/10.5281/zenodo.21879576
驯服请求不平衡:面向解聚LLM推理的SLO感知调度
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。
通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。
平滑斜坡而非峰值:LLM推理的调度诱导功率动态及其电网级后果
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 该研究揭示LLM分块预填充调度可降低功率斜坡速率,随系统饱和度提升效益增大,经转化为电网调节备用采购问题后,可减少电网快速斜坡备用容量,为运营商提供无成本需求侧塑形工具。
Comments 15 pages, 9 figures
Hollow-LLM攻击:LLM推理零知识验证中的计算上微不足道的权重
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 该研究提出Hollow-LLM攻击,利用LLM零知识验证的工作量缺口,通过嵌入幽灵权重使不诚实提供者以小模型成本生成有效证明,需额外措施绑定正确性与计算工作。
Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (S&P 2026)
基于新版本LLM的测试生成技术表现如何?
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。
高效多轮LLM推理的解耦服务
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
基于LLM的用户画像用于大规模推荐
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出实时生成LLM用户兴趣画像的框架,通过知识蒸馏、异步推理和语义聚类优化,平衡利用-探索权衡,提升大规模视频推荐效果。
Comments Accepted by 2026 RecSys Industry Track
受限API访问下LLM架构属性的黑盒推断
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Pittsburgh Supercomputing Center(匹兹堡超级计算中心)
专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。
QueenBee Planner:面向Token高效LLM多智能体系统的技能演化通信拓扑
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出QueenBee Planner框架,将智能体间通信拓扑视为可检索和自改进的设计技能,通过外部LLM规划器学习生成时间通信DAG,并利用执行轨迹蒸馏出设计规则,在固定工人池下实现通信结构的自我演化,降低消息数、模型调用和token成本。
GB级末级缓存中的缓存驻留LLM推理
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种缓存驻留执行模型,通过权重-注意力解耦架构和子算子依赖同步,在具有GB级末级缓存的CPU上实现LLM推理加速,TPOT提升2.04-13.9倍。
ReMP:面向LLM服务的低停机时间运行时模型并行重配置
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出ReMP框架,通过解耦拓扑与运行时状态、二维KV缓存迁移等技术,实现LLM推理服务中模型并行拓扑的在线动态调整,将重配置停机时间从分钟级降至1-7秒。
NPU系统上LLM推理的延迟预测
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对NPU上LLM推理延迟预测面临微架构不公开、编译器优化不可预测和分桶导致非线性延迟的挑战,提出LENS延迟估计器,通过每个桶两次端到端测量组合预测任意输入输出长度组合的延迟,平均预测误差2.15%。
Comments 12 pages, 9 figures
LUMEN:分布式LLM服务的协调故障恢复
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对分布式LLM服务中工作节点故障导致KV缓存丢失和请求重算的问题,提出LUMEN系统,通过负载感知的协调恢复策略(检查点放置、中断请求分配、容量恢复)显著提升服务与恢复时间。
Bifrost: 面向隐私保护Transformer和LLM服务的混合TEE-FHE推理架构
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Bifrost混合架构,利用CPU TEE处理非线性操作和状态刷新,FHE加密线性层委托给加速器,实现安全高效的LLM推理,相比纯FHE方案延迟降低9-53倍。
评估LLM编码代理在不同架构上的SZ系列有损压缩
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。
Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop
接近香农极限的无损LLM权重压缩
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 通过熵分析发现LLM权重有效熵远低于存储位宽,提出基于非对称数字系统的瓦片级无损解压框架,实现接近香农极限的压缩率,在SGLang中集成后显著提升批处理大小和吞吐量。
Comments Accepted to ISCA 2026
STEPS: 面向LLM辅助自然语言驱动的边缘AI服务的语义契约引导调度
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出STEPS框架,通过语义契约将用户自然语言需求转化为可执行接口,利用LLM解析服务级别和置信度,构建势博弈模型联合优化节点选择、资源分配和带宽分配,提升语义契约满足率并适应模糊请求。
Compass:面向LLM推理服务工作负载的异构多芯粒加速器映射与硬件协同探索
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM推理服务的动态请求类型和可变序列长度,提出Compass框架,通过基于计算执行图的映射编码方案和协同优化引擎,在异构多芯粒加速器上实现延迟降低63.92%、能耗降低40.32%。
ProServe: 面向LLM服务的统一多优先级请求调度
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM服务中多优先级请求的SLO保障问题,提出ProServe框架,通过引擎层滑动批处理和块管理优化及服务层增益导向调度,最大化服务增益。
Comments 17 pages
Maestro: 面向基于LLM的多智能体系统的工作负载感知跨集群调度
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Maestro调度系统,利用智能体语义预测输出长度和内存使用,通过层次化调度(节点级多模型共置、集群级延迟感知路由、全局工作流感知优先级)在严格GPU预算下优化LLM多智能体服务,减少KV缓存HBM占用67.2%,提高高竞争SLO达标率23.6个百分点。
Comments Accepted to the 46th IEEE International Conference on Distributed Computing Systems (ICDCS 2026). 11 pages