arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2606.15076 2026-06-16 cs.DC 新提交 86%

A RAG-Enhanced Bi-Level Cognitive Orchestration Framework for LEO Satellite Networks

一种面向LEO卫星网络的RAG增强双层认知编排框架

Yuhong Jiang, Zhishu Shen, Tong Yin, Qiushi Zheng, Yichao Jin, Fidan Mehmeti, Jiong Jin

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LEO卫星网络中资源碎片化问题,提出RAG增强的双层认知编排框架,上层LLM利用离线专家知识库动态推断偏好权重,下层遗传调度器计算路由与任务卸载方案,在Walker-Delta网络测试中丢包率降低30.7%,能效提升30%,端到端时延降低8.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15008 2026-06-16 cs.CR 新提交 86%

Security Engineering of OpenClaw: Analyzing Attack Surface Expansion and Trust-Boundary Violations

OpenClaw的安全工程:分析攻击面扩展与信任边界违反

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14164 2026-06-15 cs.SE cs.CR 新提交 86%

Investigating Metamorphic Fuzz Oracle Enhancement via Large Language Models

通过大语言模型研究蜕变式模糊测试预言增强

Ruixiang Qian, Ding Yang, Zengxu Chen, Yuxuan Gao, Chunrong Fang, Chao Zhang, Zhenyu Chen

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract)

AI总结 提出基于大语言模型的MetaFOE框架,自动生成和集成蜕变关系以增强模糊测试预言,在OSS-Fuzz驱动上平均提升18.7%边覆盖并触发1528个独特崩溃。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 85%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 85%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24762 2026-07-29 cs.AI cs.PF 新提交 85%

Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels

Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架

Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。

Comments The code is available at: https://github.com/TheJoshBrod/KernelForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22578 2026-07-28 cs.AI 新提交 85%

HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization

HeraSys:通过细粒度端到端优化实现多个大语言模型工作流的协同服务

Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型服务系统,HeraSys通过细粒度编排消除工作流间计算冗余,引入负载感知联合调度策略,结合资源倾斜机制等,有效减轻尾部延迟并提高吞吐量,实验证明其能显著降低延迟、提升服务吞吐量。

Comments to be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24714 2026-07-28 quant-ph cs.AI cs.ET 新提交 85%

Efficient LLM-Generated Shuttling Compilers for Complex Trapped-Ion Architectures

用于复杂囚禁离子架构的高效大语言模型生成的穿梭编译器

Fabian Kreppel, Reza Salkhordeh, Ferdinand Schmidt-Kaler, André Brinkmann

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用大语言模型Claude Opus 4.7和Claude Fable 5为复杂囚禁离子架构生成穿梭编译器,经实验对比,该编译器能有效减少穿梭时间步,无需人工算法工程,大幅缩短新架构开发时间。

Comments 56 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21602 2026-07-27 cs.AI 新提交 85%

Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

用于异构边缘设备上快速大语言模型筛选的可迁移延迟预测

Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari, Anu G. Bourgeois, Haoxin Wang

机构 * Georgia State University(佐治亚州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对异构边缘设备上大语言模型的延迟预测问题,提出运行时感知延迟预测框架,将推理请求配置化,分阶段处理并融合数据,经实验验证该框架能降低分析成本,支持跨平台部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20481 2026-07-24 cs.AI 新提交 85%

Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载

Evan Chen, Shiqiang Wang, Kevin S Chan, Su Wang, Christopher Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Army Research Laboratory(陆军研究实验室) Princeton University(普林斯顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19894 2026-07-23 cs.CR cs.AI 新提交 85%

Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

使用关键神经元隔离剪枝防御大语言模型后门攻击

Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型后门攻击问题,提出DeCNIP方法,利用表征分析统一识别和中和后门,通过优化交叉熵损失发现潜在威胁,隔离并剪枝后门关键神经元,有效降低攻击成功率,保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19349 2026-07-23 cs.AI 新提交 85%

FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads

FineServe:一个细粒度的数据集以及对全球大语言模型服务工作负载的特征描述

Tiancheng Zhang, Shaoyuan Huang, Mingyuan Wang, Yunfeng Zhao, Xiaofei Wang, Wenyu Wang

机构 * Tianjin University(天津大学) PPIO Cloud (Shanghai) Co., Ltd.(PPIO云(上海)有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型服务中高效服务面临的挑战,提出FineServe数据集,能对异构模型和任务的服务动态进行细粒度特征描述。通过分析得出波动模式,开发工作负载生成器,为评估相关策略提供现实基础。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17994 2026-07-21 cs.CV cs.AI 新提交 85%

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向

Rui Chu, Yingjie Lao

机构 * Tufts University(塔夫茨大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17652 2026-07-21 cs.AI 新提交 85%

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models

FlowBlock:用于自校正扩散语言模型的波前并行解码

Bing Tian, Haikun Liu, Xiaocheng Zhong, Zhuohui Duan, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Xiaofei Liao

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究针对块级扩散大语言模型块间解码串行问题,提出无需训练的\flowblock{}并行解码框架,基于门控波前解码和异构波前打包机制,相比串行模型提升了每秒令牌数、降低延迟并提高准确率,优于基于训练的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16184 2026-07-20 cs.LG 新提交 85%

PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

PagedWeight:通过动态质量感知权重量化实现高效的混合专家语言模型服务

Yuchen Yang, Yifan Zhao, Anisha Dasgupta, Sasa Misailovic

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究KV缓存密集场景下MoE模型权重与缓存的矛盾,提出PagedWeight方法,通过动态量化权重平衡精度与缓存大小,在多个内存敏感场景中改进质量-内存权衡,实现高精度、高内存节省及吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14277 2026-07-17 cs.CL 新提交 85%

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

多头潜在控制:大语言模型智能体决策的统一接口

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada Co., Ltd.(华为加拿大技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型作智能体时的决策控制问题,提出多头潜在控制方法,通过读取冻结模型的隐藏状态轨迹生成控制信号,能在不修改模型的情况下进行事后适配,改善多模型系统质量成本权衡,减少大模型使用并提高工具使用决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交 85%

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09403 2026-07-13 cs.AI 新提交 85%

Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review

虚构世界构建:基于分层上下文压缩和迭代审查的多智能体大语言模型协作

Jingbo Chen, He Wang, Wei Yuan, Yuqiao Lai, Zhenyan Lu

机构 * National University of Defense Technology(国防科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型应用于世界构建面临的挑战,提出AutoWorldBuilder多智能体协作系统,通过五个组件应对,经实验验证,该系统在世界构建任务中有高成功率,能高效生成自洽概念,其架构模式可推广到其他知识密集型多智能体大语言模型应用。

Comments 36 pages, 7 fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09330 2026-07-13 cs.AI cs.MA 新提交 85%

Communication-Efficient Digital-Twin Coordination for Heterogeneous LLM Embodied Agents over Computing Power Networks

基于计算能力网络的异构大语言模型实体代理的通信高效数字孪生协调

Nuocheng Yang, Sihua Wang, Zihan Chen, Tony Q. S. Quek, Changchuan Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对异构大语言模型实体代理协作面临的通信开销大、协调质量受LLMs能力限制和行动延迟等挑战,提出基于轻量级数字孪生的LDT-Coord框架,通过特定方法减少通信开销,实现与传统方法相当的任务成功率且保持鲁棒性。

Comments 14 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08791 2026-07-13 cs.NE cs.AI 新提交 85%

LLM-Driven Evolutionary Generation of Multi-Objective Bayesian Optimization Algorithms

基于大语言模型驱动的多目标贝叶斯优化算法的进化生成

Georgios Laskaris, Reuben Brasher, Niki van Stein, Elena Raponi, Thomas Bäck, Florian Neukart

机构 * LIACS, Leiden University, Leiden, Netherlands(LIACS,莱顿大学,莱顿,荷兰)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何设计多目标贝叶斯优化算法,核心方法是将LLaMEA框架扩展到MOBO,利用大语言模型生成算法并集成超参数优化。主要贡献是生成的算法在合成和实际工程问题上表现优异,能以低成本实现帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07817 2026-07-10 cs.CV cs.AI 新提交 85%

DreamCharacter-1: From 3D Generative Foundation Models to Product-Ready Character Generation

DreamCharacter-1:从3D生成基础模型到产品就绪的角色生成

Weizhe Liu, Yunjie Wu, Xiangqian Shu, Guangwei Wang, Xiangyu Xu, Peng Li, Yujie Li, Hengkai Guo

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :foundation model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究提出DreamCharacter-1框架,基于3D基础主干,通过几何后期训练、纹理后期训练和推理加速三个组件,将预训练模型校准用于3D角色生成,实验证明该框架能生成高质量角色资产,超越现有方法。

Comments Official Page: https://dreamcharacter-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交 85%

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 85%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05475 2026-07-08 cs.AR cs.AI 新提交 85%

Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

你的NPU是否适用于大语言模型?剖析移动大语言模型推理中隐藏的效率瓶颈

Guanyu Cai, Ruiming Tian, Lang Yang, Zhouhong Ren, Jinliang Yuan, Lingkun Li, Jiliang Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究剖析移动大语言模型推理隐藏的效率瓶颈,通过跨层测量及PowerBench工具,发现框架性能差距在NPU上被放大、不同后端在不同阶段各有优劣及存在调度空间浪费,据此提出配置可降NPU后端能耗54.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03174 2026-07-07 cs.SE cs.AI 新提交 85%

Effectiveness of LLM-based Software Diversity for Reliability Improvement -- an Empirical Study

基于大语言模型的软件多样性对可靠性提升的有效性——一项实证研究

Gabriel Almeida, Ilir Gashi, Vladimir Stankovic, João R. Campos

机构 * University of Coimbra, CISUC/LASI(科英布拉大学,CISUC/LASI) Centre for Software Reliability(软件可靠性中心) Department of Informatics Engineering(信息工程系) Department of Computer Science(计算机科学系) City St George’s, University of London(伦敦城市圣乔治大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型能否成为软件多样性的实用生成器及提升可靠性程度。通过扩展经典实证研究,对多种规范程序进行测试,探索大语言模型多样性多维度影响,结果表明其能助力可靠性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01678 2026-07-03 cs.LG cs.DC 新提交 85%

SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication

SCAPE:基于极端稀疏通信的高效准确大语言模型训练

Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SCAPE分布式优化器,利用AdamS的一阶矩稳定性实现高稀疏度通信,通过基于一阶矩的掩码生成、分片并行和延迟掩码策略,在90%-99%稀疏度下保持模型质量,并减少端到端训练时间达43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 85%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27866 2026-06-29 cs.LG 新提交 85%

FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

FlexMoE:面向MoE语言模型的一体化嵌套专家内剪枝方法

Fan Mo, Yuxuan Han, Geng Zhang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlexMoE方法,通过专家通道重要性排序和离散动作学习,将预训练MoE大语言模型转换为嵌套子网络族,支持跨预算部署,在Qwen2-57B-A14B上剪枝50%路由专家参数仍保留约99.8%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26861 2026-06-26 cs.CL 新提交 85%

Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT

面向工业物联网设备端大模型推理的级联多粒度剪枝

Jinghan Wang, Yanjun Chen, Wei Zhang, Xiaotong Huang, Tianchen Liu, Gaoliang Peng

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出级联多粒度剪枝框架,通过粗到细顺序移除层、注意力头和前馈通道,并利用轻量级低秩恢复重新估计重要性,在MHA+GELU架构上实现13.8倍压缩和83.82%准确率,在工业物联网设备上降低推理延迟67.2%。

Comments This work has been submitted to the IEEE Internet of Things Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23087 2026-06-23 cs.LG 新提交 85%

FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models

FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练

Zhida Jiang, Zhaolong Xing, Yang Pei, Xiaolong Chen, Yuanhang Xiao, Chengzhi Huang, Xiyu Liu, Haopeng Liu, Qingyuan Sang, Lingfeng Zhou, Jiaxing Wang, Zicheng Zhang, Wenzhe Wang, Xinyu Liu, Yan Li, Zhen Chen, Ke Zhang

机构 * Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏