arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 126 篇

2606.14711 2026-06-16 cs.DC 新提交 95%

SWARM-LLM: Collaborative Inference for Edge-based Small Language Models

SWARM-LLM:基于边缘的小语言模型的协同推理

Mostafa Dahshan, Quazi Mamun, Tanmoy Debnath

专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)

AI总结 提出SWARM-LLM路由协作层,通过轻量级不确定性估计和安全信号,在边缘SLM、对等SLM协作和云端FM之间动态选择查询处理方式,实现精度、延迟和成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10104 2026-06-16 cs.CR cs.AI cs.IR 交叉投稿 92%

Phishing Email Detection Using Large Language Models

使用大型语言模型检测钓鱼邮件

Najmul Hasan, Prashanth BusiReddyGari, Haitao Zhao, Yihao Ren, Jinsheng Xu, Shaohu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出LLMPEA框架,利用GPT-4o等三种前沿LLM检测钓鱼邮件,准确率超90%,并揭示对抗攻击、提示注入和多语言攻击的漏洞。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15199 2026-06-16 cs.AI 新提交 92%

CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services

CogGuard:边缘智能服务中基于认知与操作画像的主动预警

Zhi Yao, Weihao Chen, Zhiqing Tang, Hanshuai Cui, Qianli Ma, Weijia Jia, Wei Zhao

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学) Guangdong Key Lab of AI and Multi-modal Data Processing(广东省人工智能与多模态数据处理重点实验室) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究院) Engineering Center of AI and Future Education(人工智能与未来教育工程中心) Guangdong Provincial Department of Science and Technology(广东省科学技术厅) Zhuhai Science-Tech Innovation Bureau(珠海市科技创新局) Beijing Normal University at Zhuhai(北京师范大学珠海校区)

专题命中 效率与部署 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出CogGuard框架,通过解耦离线LLM画像构建与在线SLM评分预测,结合前缀对齐KV缓存重用和长度感知分布式微调,实现边缘智能服务的主动预警,在教育和操作任务上降低构建时间48%、微调时间19%。

Comments Accepted to ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04592 2026-06-16 cs.CL cs.CV 交叉投稿 92%

From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models

从静态推理到动态交互:流式大型语言模型综述

Junlong Tong, Zilong Wang, YuJie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文统一了流式LLM的定义,提出系统分类法,综述其方法、应用与未来方向。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16352 2026-06-16 cs.LG cs.AI 新提交 92%

Communication-Efficient Verifiable Attention for LLM Inference

面向LLM推理的高效通信可验证注意力机制

Ziqun Chen, Ming Wu, Michael Heinrich, Jason Zeng, Huiying Lan, Tianwei Zhang, Rui Tan

机构 * Nanyang Technological University(南洋理工大学) Zero Gravity Labs(零重力实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VeriAttn,通过将注意力计算卸载到GPU并由TEE验证,结合两阶段流水线和分区策略,显著降低TEE计算和通信开销,实现LLM推理加速。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15508 2026-06-16 cs.AI 新提交 92%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15789 2026-06-16 cs.AR 新提交 91%

Approaching Shannon Bound with Lossless LLM Weight Compression

接近香农极限的无损LLM权重压缩

Hongshi Tan, Yao Chen, Gustavo Alonso, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过熵分析发现LLM权重有效熵远低于存储位宽,提出基于非对称数字系统的瓦片级无损解压框架,实现接近香农极限的压缩率,在SGLang中集成后显著提升批处理大小和吞吐量。

Comments Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09537 2026-06-16 cs.NI 新提交 91%

STEPS: Semantic Contract-Guided Scheduling for LLM-Assisted Natural Language-Driven Edge AI Services

STEPS: 面向LLM辅助自然语言驱动的边缘AI服务的语义契约引导调度

Houyi Qi, Minghui Liwang, Xianbin Wang, Xinlei Yi, Seyyedali Hosseinalipour

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出STEPS框架,通过语义契约将用户自然语言需求转化为可执行接口,利用LLM解析服务级别和置信度,构建势博弈模型联合优化节点选择、资源分配和带宽分配,提升语义契约满足率并适应模糊请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06093 2026-06-16 cs.AR 版本更新 91%

Compass: Co-Exploration of Mapping and Hardware for Heterogeneous Multi-Chiplet Accelerators Targeting LLM Inference Service Workloads

Compass:面向LLM推理服务工作负载的异构多芯粒加速器映射与硬件协同探索

Boyu Li, Zongwei Zhu, Qianyue Cao, Xi Li, Xuehai Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理服务的动态请求类型和可变序列长度,提出Compass框架,通过基于计算执行图的映射编码方案和协同优化引擎,在异构多芯粒加速器上实现延迟降低63.92%、能耗降低40.32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 91%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16014 2026-06-16 cs.HC cs.AI cs.MA 新提交 91%

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

编排现实:从角色扮演到活生生的、可玩的游戏世界——作为参数化动作POMDP的LLM驱动世界模拟

Yuhang Huang, Chenmiao Li, Chaowei Fang

机构 * The University of Tokyo(东京大学) Individual Researcher(个人研究员)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出编排现实框架,将LLM驱动的游戏世界形式化为参数化动作POMDP,通过单例编排代理维护规范JSON状态,实现数值状态、叙事声音和规则逻辑的统一协调。

Comments 9 pages, 2 figures. Work in progress. Yuhang Huang and Chenmiao Li contributed equall

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00482 2026-06-16 cs.LG 版本更新 90%

AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models

AREAL-DTA:用于大语言模型高效强化学习的动态树注意力机制

Jiarui Zhang, Yuchen Yang, Ran Yan, Zhiyu Mei, Liyuan Zhang, Daifeng Li, Wei Fu, Jiaxuan Gao, Shusheng Xu, Yi Wu, Binhang Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);post-training(abstract)

AI总结 针对RL后训练中rollout序列共享前缀导致计算冗余的问题,提出基于深度优先搜索的动态树注意力机制,结合负载均衡分布式批处理,实现高效前缀共享,训练吞吐量提升最高8.31倍。

Comments Accepted at ICML 2026. Camera-ready version. Code: https://github.com/areal-project/AReaL/tree/feat/dta

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16100 2026-06-16 cs.CR cs.CL cs.LG 新提交 90%

Your "Pro" LLM Subscription May Actually Be "Free": Exposing Fingerprint Spoofing Risks in LLM Inference Services

你的“专业”LLM订阅可能实际上是“免费”的:揭示LLM推理服务中的指纹欺骗风险

Jiahao Zhang, Xiuyu Li, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出指纹欺骗攻击,恶意服务商通过参数高效微调弱模型模仿强模型,绕过用户指纹验证;理论证明用户资源限制导致指纹易被欺骗,并设计GhostPrint攻击框架,实验表明其能以低成本持续绕过主流指纹方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15652 2026-06-16 cs.LG cs.CL 新提交 90%

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

MosaicQuant: 基于内点-离点分离的统一4位LLM量化

Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

机构 * HKUST(香港科技大学) EPFL(瑞士联邦理工学院洛桑) MetaX Integrated Circuits Co., Ltd(MetaX集成电路有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MosaicQuant,通过将权重矩阵量化为密集4位基分量和稀疏4位残差分量,结合ZipperEngine融合稀疏块计算,实现统一4位推理,在LLaMA3和Qwen3上保持近FP16精度并加速1.24倍。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15333 2026-06-16 cs.CL cs.LG 新提交 90%

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

重放重要内容:面向高效LLM强化反学习的离策略重放

Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对LLM反学习中在线策略优化对困难样本利用不足的问题,提出ReRULE方法,通过离策略重放缓冲区存储并复用低奖励困难样本,在保持通用性的同时提升反学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 90%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05163 2026-06-16 cs.CL cs.LG 版本更新 90%

Enhancing LLM Safety Through a Theoretical Minimax Game Lens

通过理论极小极大博弈视角增强LLM安全性

Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, Bo Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) VirtueAI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。

Comments 24 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00887 2026-06-16 cs.CL cs.AI cs.LG 版本更新 90%

EffGen: Enabling Small Language Models as Capable Autonomous Agents

EffGen: 使小型语言模型成为能干的自主智能体

Gaurav Srivastava, Aafiya Hussain, Chi Wang, Yingyan Celine Lin, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Google DeepMind, USA(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。

Comments Accepted to ICML 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 90%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16332 2026-06-16 cs.DC cs.AI cs.PF 新提交 90%

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

SMEPilot: 利用可扩展矩阵扩展表征和优化LLM推理

Feiyang Chen, Haibo Chen

机构 * IPADS, Shanghai Jiao Tong University(上海交通大学IPADS)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对CPU矩阵扩展单元与核心在LLM推理中的不匹配,提出SMEPilot引擎,通过基于屋顶线的表征指导算子执行选择,实现SME与CPU协同工作,端到端性能提升达3.94倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06302 2026-06-16 cs.LG cs.SE 版本更新 90%

Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving

Tangram: 解锁非均匀KV缓存以实现高效的多轮LLM服务

Hyungmin Kim, Minsoo Kim, Hongseok Kim, Jungwook Choi

机构 * Hanyang University(翰林大学) Rebellions Republic of Korea(Rebellions)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对多轮LLM服务中KV缓存线性增长导致的GPU内存和带宽压力,提出Tangram系统,通过确定性预算分配、头组页面和提前负载均衡三项技术实现非均匀KV缓存的高效管理,吞吐量提升达2.6倍。

Comments 13 pages. 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04547 2026-06-16 cs.IR cs.CL 版本更新 90%

Beyond Retrieval: Learning Compact User Representations for Scalable LLM Personalization

超越检索:学习紧凑用户表示以实现可扩展的LLM个性化

Heng Cao, Fan Zhang, Jian Yao, Yujie Zheng, Changlin Zhao, Lu Hao, Yuxuan Wei, Wangze Ni, Huaiyu Fu, Yuqian Sun, Xuyan Mo

机构 * Microsoft(微软公司) Shanghai International Studies University(上海国际问题研究大学) Zhejiang University(浙江大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TAP-PER框架,通过可学习的用户状态前缀嵌入编码用户偏好,避免显式提示构建和繁重的每用户适配器,在六个LaMP任务上优于基线方法,并显著减少参数开销。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09309 2026-06-16 cs.AI 版本更新 90%

Rescaling Confidence: What Scale Design Reveals About LLM Metacognition

重新缩放置信度:量表设计揭示LLM元认知

Yuyang Dai, Yuxia Wang

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学‘圣克莱门特·欧里德斯基’)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究LLM口头置信度受量表设计影响,发现0-20量表比标准0-100量表更有效提升元认知效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02908 2026-06-16 cs.LG cs.DC 版本更新 90%

Photon: Federated LLM Pre-Training

Photon: 联邦大语言模型预训练

Lorenzo Sani, Alex Iacob, Zeyu Cao, Royson Lee, Bill Marino, Yan Gao, Dongqi Cai, Zexi Li, Wanru Zhao, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Photon系统,首次实现联邦端到端LLM预训练,通过跨孤岛联邦学习在弱连接GPU上训练高达7B参数模型,通信量减少64-512倍,收敛速度比DiLoCo快2倍。

Comments 18 pages, 9 appendix pages, 12 figures, 3 algorithms, 12 tables

Journal ref Proceedings of Machine Learning and Systems 7 (MLSys 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16515 2026-06-16 cs.CL cs.CR 90%

LLM-based Privacy Data Augmentation Guided by Knowledge Distillation with a Distribution Tutor for Medical Text Classification

基于知识蒸馏和分布导师的LLM隐私数据增强方法用于医学文本分类

Yiping Song, Juhua Zhang, Zhiliang Tian, Yuxin Yang, Minlie Huang, Dongsheng Li

机构 * College of Science, National University of Defense Technology, Hunan, China(国防科技大学科学学院,湖南,中国) College of Computer, National University of Defense Technology, Hunan, China(国防科技大学计算机学院,湖南,中国) The CoAI Group, DCST, BNRist, Tsinghua University, Beijing(清华大学北京人工智能研究院,北京)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出一种结合LLM和知识蒸馏的隐私数据增强方法,通过分布导师控制生成分布,提升医学文本分类的隐私保护与性能。

Journal ref Neural Networks, Vol. 199, 2026, 108668

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16264 2026-06-16 cs.DC 新提交 89%

Tropical: Enhancing SLO Attainment in Disaggregated LLM Serving via SLO-Aware Multiplexing

Tropical: 通过SLO感知的多路复用提升解聚式LLM服务中的SLO达成率

Jinming Ma, Jiefei Chen, Xiuhong Li, Jiangfei Duan, Haojie Duanmu, Xingcheng Zhang, Chao Yang, Dahua Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tropical系统,通过SLO感知的多路复用策略平衡排队时间和干扰,同时满足预填充和解码阶段的延迟约束,在真实数据集上相比现有系统提升高达2.09倍的请求数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06694 2026-06-16 cs.LG 版本更新 89%

NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models

NanoQuant: 大型语言模型高效子1位量化

Hyochan Chong, Dongkyu Kim, Changdong Kim, Minseop Choi

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出NanoQuant,一种新型后训练量化方法,能够将大型语言模型压缩到二进制和子1位水平,通过低秩二进制分解问题实现高效压缩,并在消费者硬件上实现大规模部署。

Comments Accepted to ICML 2026. Hyochan Chong and Dongkyu Kim contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11418 2026-06-16 cs.CL 版本更新 89%

CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering

CentroidKV: 通过KV缓存聚类实现高效的长上下文LLM推理

Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CentroidKV框架,通过在线聚类KV缓存减少内存占用,在保持性能的同时实现高达75%的缓存压缩和1.92倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02955 2026-06-16 cs.CL cs.AI cs.LG 版本更新 88%

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码

Siva Rajesh Kasa, Yasong Dai, Sumit Negi, Hongdong Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。

Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/

详情

展开后加载摘要…

URL PDF HTML 收藏