arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2508.03726 2026-05-29 cs.CL 87%

Hierarchical Verification of Speculative Beams for Accelerating LLM Inference

分层验证投机波束以加速大语言模型推理

Jaydip Sen, Harshitha Puvvala, Subhasis Dasgupta

机构 * Praxis Business School(普拉克斯商学院) Sabre Industries(Sabre工业公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出分层验证树(HVT)框架,通过优先验证高似然草稿并早期剪枝次优候选,以分层方式重构投机波束解码,从而在不重训练或修改架构下显著降低推理时间和能耗。

Comments This paper was accepted for oral presentation and publication in the 3rd International Conference on Data Science and Network Engineering (ICDSNE 2025), organized at NIT, Agartala, India, from July 25 to 26, 2025. The paper is 12 pages long, and it contains 3 tables and 4 figures. This is NOT the final paper, which will be published in the Springer-published proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28557 2026-05-28 cs.LO cs.AI 87%

Token Optimization Strategies for LLM-Based Oracle-to-PostgreSQL Migration

基于LLM的Oracle到PostgreSQL迁移的Token优化策略

Oleg Grynets, Dmytro Babarytskyi, Vasyl Lyashkevych

机构 * EPAM Systems(EPAM系统) Kharkiv, Ukraine(乌克兰基尔基茨) Lviv, Ukraine(乌克兰利沃夫) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文形式化并评估了十二种Token优化策略,在Oracle到PostgreSQL迁移中平衡成本、语法有效性、语义保持和结构保真度。

Comments 11 pages, 3 figures, 5 tables, 38 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28224 2026-05-28 cs.AI 87%

When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?

何时记忆有助于工具使用LLM代理的多轨迹推理?

Xinzhe Li, Yaguang Tao

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个统一框架,将记忆沿传输范围和内容抽象两个维度分解,在无验证器设置下评估四种记忆方法与三种推理策略在四个工具使用基准上的表现,发现推理策略是混淆变量,不同策略下相同记忆方法产生显著不同结果。

Comments More evaluation and analysis are on the way

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27899 2026-05-28 cs.AI 87%

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

SKILLC: 通过对比信用分配学习LLM智能体的自主技能内化

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SkillC框架,基于对比技能信用分配(CSCA)将技能帮助性对比转化为直接学习信号,实现LLM智能体的自主技能内化,在ALFWorld和WebShop上分别超越最强基线5.5%和4.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27823 2026-05-28 cs.CR cs.AI cs.CV 87%

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

解耦对抗性提示:基于语义图的鲁棒大语言模型安全防御

Xiang Fang, Wanlong Fang

机构 * Xiang Fang(1. 方翔) Wanlong Fang(2. 方万龙)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出对抗性提示解耦(APD)框架,通过互信息语义分解、图谱分析和轻量级分类器,在输入处理前识别并中和恶意组件,将有害输出减少85%以上。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02230 2026-05-27 cs.OS cs.AI cs.NI 87%

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

Continuum: 基于KV缓存生存时间的高效鲁棒多轮LLM智能体调度

Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh(Tensormesh公司) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多轮智能体工作负载中工具调用导致KV缓存无法跨轮重用的问题,提出Continuum系统,通过引入KV缓存的生存时间(TTL)机制,在GPU内存中选择性固定缓存,权衡重算/重载成本与排队延迟,实现作业完成时间平均提升8倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23985 2026-05-27 cs.LG 87%

Diet Your LLM: Dimension-wise Global Pruning of LLMs via Merging Task-specific Importance Score

精简你的大语言模型:通过融合任务特定重要性分数的维度级全局剪枝

Jimyung Hong, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种无需训练的维度级结构化剪枝方法DIET,通过跨任务激活幅度多数投票构建全局掩码,在保持任务感知能力的同时避免高昂训练成本,在Gemma-2模型上显著提升剪枝后准确率。

Comments 14 pages, 10 figures. Code available at https://github.com/Jimmy145123/DIET

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11280 2026-05-27 cs.CL 87%

AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference

AdaSD:面向高效语言模型推理的自适应推测解码

Kuan-Wei Lu, Ding-Yong Hong, Pangfeng Liu, Jan-Jan Wu

机构 * Institute of Information Science, Academia Sinica(学术院信息研究所) Department of Computer Science and Information Engineering, National Taiwan University(台湾大学计算机科学与信息工程系)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 提出一种无超参数的自适应推测解码方法AdaSD,通过动态调整生成长度和接受标准,在保持准确率下降低于1.8%的同时实现最高1.46倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23853 2026-05-26 cs.AI 87%

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace: 面向LLM智能体技能蒸馏的成本感知追踪

Boqin Yuan, Yue Su, Renchu Song, Sen Yang, Jing Qin

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对技能蒸馏管道缺乏每步成本信号的问题,提出ClawTrace记录成本归因轨迹并生成TraceCard,通过CostCraft生成保留、剪枝和修复三类技能补丁,发现剪枝补丁作为质量护栏而保留补丁导致回归,主张按规则类型评估可复用技能。

Comments Accepted at Agent Skills '26 Workshop, ACM Conference on AI and Agentic Systems (CAIS 2026), San José, CA, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12116 2026-05-26 cs.AI cs.SE 87%

The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment

A-R行为空间:组织部署中工具使用语言模型代理的执行层剖析

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff School of Technologies, Cardiff Metropolitan University(卡迪夫技术学院,卡迪夫市政大学) School of Professional Studies, Clark University(专业研究学院,克拉克大学) Harvard Medical School, Harvard University(哈佛医学院,哈佛大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 提出基于动作率(A)和拒绝信号(R)的二维A-R空间及散度(D)来测量执行层行为,评估不同规范制度和自主性配置下语言模型代理的执行与拒绝分布模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24414 2026-05-26 cs.AI 87%

JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

JT-SAFE-V2:具有世界上下文数据的安全设计基础模型

Junlan Feng, Fanyu Meng, Chong Long, Pengyu Cong, Duqing Wang, Yan Zheng, Yuyao Zhang, Xuanchang Gao, Ye Yuan, Yunfei Ma, Zhijie Ren, Fan Yang, Na Wu, Di Jin, Chao Deng

机构 * JIUTIAN Research(九天研究院)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出JT-Safe-V2大语言模型,通过世界知识预训练、高确定性训练和安全强化后训练实现通用智能与安全设计的联合优化,并引入Safe-MoMA框架降低推理成本,在通用智能和安全基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24144 2026-05-26 cs.AR cs.LG 87%

EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture

EVA:通过高效向量量化架构加速大语言模型解码

Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型解码阶段内存瓶颈和计算利用率低的问题,提出EVA架构,将GEMV计算转化为GEMM并消除内存冲突,实现最高11.17倍加速和7.17倍能效提升。

Comments 17 pages. Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23296 2026-05-25 cs.AI 87%

Parallel Context Compaction for Long-Horizon LLM Agent Serving

长视界LLM智能体服务的并行上下文压缩

Musa Cim, Burak Topcu, Chita Das, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对长视界LLM智能体对话历史超出上下文窗口的问题,提出并行压缩方法,通过细粒度控制摘要体积和提示工程,在HotpotQA和LoCoMo基准上相比顺序基线降低端到端耗时并提升压缩吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22456 2026-05-22 cs.RO cs.AI 87%

Steins;Gate Drive: Semantic Safety Arbitration over Structured Futures for Latency-Decoupled LLM Planning

Steins;Gate Drive: 基于结构化未来语义安全仲裁的延迟解耦LLM规划

Anjie Qiu, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出SteinsGateDrive架构,通过延迟解耦规划与运行时架构,在保持安全边界的同时,将有效延迟从+3.07秒减少到-0.01秒,提升了自动驾驶的规划效率。

Comments 10 pages, 2 figures, 5 tables, submitted to IEEE transaction of intelligent vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18067 2026-05-19 cs.CL 87%

PPAI: Enabling Personalized LLM Agent Interoperability for Collaborative Edge Intelligence

PPAI: 促进个性化大语言模型代理在协作边缘智能中的互操作性

Zile Wang, Qianli Liu, Kaibin Guo, Haodong Wang, Jian Lin, Zicong Hong, Song Guo

机构 * Hong Kong RGC General Research Fund(香港研究资助局一般研究基金) Research Impact Fund(研究影响基金) Collaborative Research Fund(协作研究基金) NSFC/RGC Collaborative Research Scheme(国家自然科学基金/香港研究资助局协作研究计划) Areas of Excellence Scheme(卓越领域计划) InnoHK (HKGAI)(创新科技署(HKGAI))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PPAI系统,通过代理专长实现用户间协作,解决动态代理池和负载平衡问题,提升任务准确性并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11854 2026-05-19 cs.CL 87%

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models

自蒸馏轨迹感知玻尔兹曼建模:弥合扩散语言模型训练-推理差异

Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Yibing Liu, Xinyu Fu, Shi Wu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Liu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究) The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文研究了如何利用自蒸馏轨迹进行真正的知识获取,而非仅加速推理。提出TABOM框架,通过玻尔兹曼建模对推理解屏蔽偏好建模,从而在新领域中提升扩散语言模型的表现并缓解灾难性遗忘。

Comments Project website: https://tonyckc.github.io/TABOM-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09341 2026-05-19 cs.MA cs.CL 87%

SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System

SkillMAS: 基于大语言模型的多智能体系统技能共进化

Shuai Pan, Yixiang Liu, Jiaye Gao, Te Gao, Weiwen Liu, Jianghao Lin, Zhihui Fu, Jun Wang, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) OPPO

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillMAS通过耦合技能进化与多智能体系统重构,解决部署后技能优化与系统重构的分离问题,提升多智能体系统的适应性和专业化水平。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI 87%

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16359 2026-05-19 cs.CV cs.AI 87%

How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展

YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出F^3A方法,通过任务条件证据搜索优化视觉标记分配,在不训练模型的情况下实现高效的视觉标记剪枝,保留原始多模态提示和解码流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10556 2026-05-14 cs.CV cs.LG 87%

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens: 多模态大语言模型推理服务中的可解释闭式能量模型

Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多模态大语言模型推理服务中的能量优化问题,提出EnergyLens模型,通过符号回归发现结构,构建基于系统属性的闭式能量模型,实现可解释且高效的配置选择。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08151 2026-05-13 cs.DC cs.AI 87%

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理

Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

机构 * Tsinghua University(清华大学) AI Infra Team at JDT(AI基础设施团队) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10862 2026-05-12 cs.CL 87%

RUBEN: Rule-Based Explanations for Retrieval-Augmented LLM Systems

RUBEN:基于规则的检索增强大语言模型输出解释工具

Joel Rorseth, Parke Godfrey, Lukasz Golab, Divesh Srivastava, Jarek Szlichta

机构 * University of Waterloo(滑铁卢大学) York University(约克大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RUBEN通过新型剪枝策略发现最小规则集解释检索增强大语言模型输出,用于测试安全训练和对抗性提示注入效果。

Comments Accepted by ICDE 2026 (Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03688 2026-05-12 cs.AI 87%

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

TodyComm: 任务导向的多轮LLM多智能体系统动态通信

Wenzhe Fan, Tommaso Tognoli, Henry Peng Zou, Chunyu Miao, Yibo Wang, Xinhua Zhang

机构 * Department of Compute Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出TodyComm算法,通过策略梯度优化任务效用,生成适应动态的协作拓扑,实验证明其在动态对抗和通信预算约束下表现优异,具备高效、可扩展和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15686 2026-05-12 cs.LG 87%

Beyond Hard Writes and Rigid Preservation: Soft Recursive Least-Squares for Lifelong LLM Editing

超越硬写和刚性保存:用于终身LLM编辑的软递归最小二乘法

Xinyu Wang, Sicheng Lyu, Yu Gu, Jerry Huang, Peng Lu, Yufei Cui, Xiao-Wen Chang

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(蒙特利尔AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出RLSEdit,一种递归最小二乘编辑器,通过在线二次优化和软约束实现长期序列编辑,有效平衡编辑精度与稳定性,实验显示其在多个模型家族上稳定扩展至10000次编辑,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01280 2026-05-05 cs.DC cs.AI 87%

Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

位置:大语言模型服务需要数学优化和算法基础,而不是仅仅启发式方法

Zijie Zhou

机构 * Department of Industrial Engineering and Decision Analytics(工业工程与决策分析系)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文指出大语言模型推理服务已超越通用启发式方法,需数学优化和算法基础。现有服务系统如vLLM和SGLang的算法核心仍沿用传统分布式计算方法,无法适应LLM推理的动态KV缓存、prefill-decode阶段不对称性等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00831 2026-05-05 cs.DC cs.AI cs.PF 87%

GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving

GhostServe: 一种轻量级的影子中检查点系统,用于容错的大语言模型服务

Shakya Jayakody, Youpeng Zhao, Chinmay Dhanraj Nehate, Jun Wang

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GhostServe,一种轻量级检查点系统,通过擦除编码在主机内存中生成和存储奇偶分片,以保护流式KV缓存,提升大语言模型服务的容错性和效率。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00519 2026-05-04 cs.PF cs.AI cs.AR 87%

Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference

硅的对决:消费级大语言模型推理中的性能、效率与生态系统障碍

Allan Kazakov, Abdurrahman Javat

机构 * Bahcesehir University(巴切希尔大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文比较了Nvidia和Apple Silicon生态系统在部署大规模大语言模型时的性能、效率和生态系统挑战,揭示了不同架构在内存容量和计算密度上的差异及影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00043 2026-05-04 cs.DB cs.AI cs.MA 87%

SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms

SiriusHelper:一种基于LLM代理的大数据平台操作助手

Yu Shen, Shiyang Liu, Qihang He, Yihang Cheng, Haining Xie, Zhiming He, Huahua Fan, Xianzhi Tan, Teng Ma, Shaoquan Zhang, Danqing Huang, Fan Jiang, Yang Li, Chongqing Zhao, Peng Chen, Jie Jiang, Bin Cui

机构 * TEG, Tencent Inc.(腾讯科技(TEG)) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11329 2026-05-04 cs.DC cs.LG 87%

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave:分布式大语言模型推理中的高效计算-通信重叠

Raja Gond, Nipun Kwatra, Ramachandran Ramjee

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TokenWeave通过优化RMSNorm与通信的融合核,实现高效计算-通信重叠,提升低token长度下的推理性能,实验显示延迟降低1.28倍,吞吐量提升1.19倍。

Comments Accepted at MLSys 2026. In Versions 1 and 2, Figure 6 erroneously reports Multimem-AllReduce bandwidth rather than Multimem Reduce-Scatter bandwidth. In Version 4, we corrected the x-axis tick labels in Figure 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27844 2026-05-01 cs.DC cs.CL 87%

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

ZipCCL: 通信集体的高效无损数据压缩以加速大语言模型训练

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ZipCCL,通过理论编码、GPU优化内核和自适应策略,实现通信数据的无损压缩,减少通信时间并提升训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏