arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2606.17464 2026-06-17 cs.LG 新提交 85%

CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

CheckMIABench: 语言模型成员推理攻击的坚实基础

Jeffrey G. Wang, Jason Wang, Marvin Li, Seth Neel

机构 * Harvard University(哈佛大学) Harvard Business School(哈佛商学院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 为解决成员推理攻击评估中的分布偏移问题,提出基于训练中固定点前后数据同分布的基准框架,在Pythia和OLMo模型上评估多种攻击,并开源模块化库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16461 2026-06-16 cs.LG 新提交 85%

Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

对称性带来的隐私:用于大语言模型推理的正交等变Transformer

Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对拆分推理中隐藏表示易被近邻搜索恢复的问题,提出正交混淆方法,并设计ConjFormer架构实现O(d)-等变性,在不加噪声或重加密下将令牌恢复率从35%降至1.3%,困惑度仅增0.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16383 2026-06-16 cs.CL 新提交 85%

Surpassing Scale by Efficiency: A Compact 135M Parameter Foundational LLM Natively Adapted for the Bangla Language

通过效率超越规模:一个紧凑的135M参数基础LLM原生适配孟加拉语

Rabindra Nath Nandi

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出一个135M参数的紧凑型解码器模型bangla-smollm-135m,通过确定性交集-追加词元合并策略解决孟加拉语子词碎片化,在零样本多任务基准上匹配或超越两倍大小模型。

Comments Submitted to a Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15453 2026-06-16 cs.AR cs.LG 新提交 85%

A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

面向高效MoE大语言模型推理的时空专家预取框架

Yingnan Zhao, Razvan Bunescu, Ahmed Louri, Avinash Karanth, Ke Wang

机构 * George Washington University(乔治华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Ohio University(俄亥俄大学)

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对MoE大模型推理中专家加载延迟问题,通过分析专家选择行为的时空相关性,提出ST-MoE框架,结合轻量级运行时预测和可重构硬件设计,实现专家预取以重叠计算与加载,提升性能与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08476 2026-06-09 cs.DC cs.AI 新提交 85%

FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training

FlashCP: 面向LLM训练的负载均衡且通信高效的上下文并行

Zheng Wang, Eric Liu, Linan Jiang, Zhongkai Yu, Zaifeng Pan, Yue Guan, Yuke Wang, Yufei Ding

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出FlashCP框架,通过分片感知通信消除冗余KV传输,并设计Whole-Doc分片策略与启发式算法,实现负载均衡与通信高效,在多种数据集上取得最高1.63倍加速。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10939 2026-08-12 cs.CL cs.AI 新提交 85%

A Cost-Efficient Routing Pipeline for Multilingual Short-Text Classification Using Small Language Models

使用小型语言模型的低成本多语言短文本分类路由流水线

Wajdi Ben Saad, Safa Madiouni

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.CL、cs.AI

AI总结 本研究提出一种使用小型语言模型的多语言短文本分类路由流水线,通过选择性翻译低资源语言提升分类性能,在两个基准上验证了该策略的有效性。

Comments Accepted for publication at the 16th International Conference on Advanced Computer Information Technologies (ACIT 2026), https://acit.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29602 2026-08-03 cs.CL cs.AI cs.CV cs.HC 新提交 85%

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

FriendBench:人类与多模态大语言模型的二元熟悉度推理基准

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

机构 * Fluid Concepts Research(流体概念研究机构)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28319 2026-07-31 cs.CL cs.CY cs.LG 新提交 85%

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

公平剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Fairness Pruning方法,通过最小对比提示对与激活捕获定位LLM的GLU-MLP层中人口统计偏差神经元,经实验验证该方法可针对性调控偏差且对模型能力影响极小。

Comments 15 pages, 3 figures, 9 tables. Code and datasets publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15525 2026-07-20 cs.LG cs.AI 新提交 85%

Kolmogorov--Arnold Networks for Small Language Models

用于小型语言模型的柯尔莫哥洛夫-阿诺德网络

Felippe Alves, Renato Vicente

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.AI、cs.LG

AI总结 研究探讨柯尔莫哥洛夫-阿诺德网络(KANs)能否替代变压器前馈网络。通过在特定KAN中重建边缘、修剪等测试其特性,还评估多种网络在BabyLM等上的表现。结果表明小基KANs可用于审计标量变换,但替代方案未展现优于MLP基线的一致优势。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08754 2026-07-10 cs.LG cs.AI 新提交 85%

SLORR: Simple and Efficient In-Training Low-Rank Regularization

SLORR:简单高效的训练中低秩正则化

David González-Martínez, Shiwei Liu

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对神经网络低秩正则化难题,提出简单无状态的SLORR框架,基于霍耶尔稀疏性度量和核范数有两个变体,通过GPU友好近似正则化权重矩阵,在ImageNet-1K及LLM预训练中验证其能在低开销下诱导可压缩性并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交 85%

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12876 2026-06-12 cs.LG cs.CL cs.IT math.IT 新提交 85%

Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

使用加性码本的大语言模型多比特宽度量化

Liza Babaoglu, Shuangyi Chen, Ashish Khisti

机构 * University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出Drop-by-Drop框架,基于信息论和逐次细化理论,利用加性码本和Matryoshka监督实现单个模型在推理时支持多精度权重控制,降低存储开销并保持性能。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 85%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11045 2026-06-10 cs.AI cs.LG 新提交 85%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08446 2026-06-09 cs.LG cs.AI 新提交 85%

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout

Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Intel(英特尔) Amazon AGI(亚马逊AGI)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07690 2026-06-09 cs.LG cs.AI 新提交 85%

HARP: Efficient Data Selection for Finetuning Large Language Models

HARP:高效数据选择用于微调大型语言模型

Ning Wang, Zhengxin Zhang, Maosen Tang, Yitang Gao, Claire Cardie, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 提出层次主动区域剪枝(HARP),一种高效的基于训练的数据选择方法,通过层次结构和经验贝叶斯推断降低选择成本,同时保持下游对齐,在多个基准上优于最强基线最多8.9分,且训练样本减少约7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07500 2026-06-08 cs.LG cs.AI 新提交 85%

Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning

稀疏子空间到专家共享的任务无关持续学习

Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SETA框架,通过将参数分解为任务特定专家和共享专家的稀疏子空间,结合自适应弹性锚定和路由感知正则化,解决LLM持续学习中的塑性-稳定性困境,在多个基准上优于现有方法。

Comments 19 pages. arXiv admin note: text overlap with arXiv:2601.17616

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14333 2026-08-17 cs.AR 新提交 85%

Beyond Capacity: Scalable MoE LLM Inference via High-Bandwidth Flash with Direct GPU and HBM Paths

超越容量:通过具有直接GPU和HBM路径的高带宽闪存实现可扩展的MoE大语言模型推理

Seeyeon Kim, Juhyeong Jin, Joo-Young Kim

专题命中 效率与部署 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对MoE大语言模型推理的HBM容量瓶颈,提出同时利用HBF到GPU的直接路径和HBF经HBM到GPU的中继路径的架构,可提升专家传递效率,实现1.94倍吞吐量与1.90倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07076 2026-08-10 cs.SE 新提交 85%

Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study

面向专用语言模型的解释引导式变异测试:一项实证研究

Xingcheng Chen, Mehmet Besenk, Andrea Stocco

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。

Comments 20 pages, 4 figures. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28418 2026-07-31 cs.AI cs.CL cs.LG 新提交 85%

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

WIDE:通过令牌级动态宽度剪枝提升自适应大语言模型推理效率

Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学宁波数字孪生研究院) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WIDE是首个端到端可微令牌级动态宽度剪枝框架,通过两阶段训练与剪枝-内核协同设计,在50%稀疏度下实现显著推理加速与更优精度保持,性能优于现有动态剪枝方法。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 85%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24788 2026-07-29 cs.AI cs.CL cs.LG 新提交 85%

GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference

GLIDE:用于高效大语言模型推理的引导式分层混合注意力机制

Vimal William, Ravi Tandon, Jyotikrishna Dass

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型推理时KV缓存瓶颈问题,提出GLIDE引导式分层混合注意力机制,通过分层自适应平衡线性循环与softmax窗口,非均匀压缩softmax占用空间,实现性能-效率权衡,降低长上下文生成延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18957 2026-07-22 cs.DC 新提交 85%

InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata

InstantInfer:使用通信有限自动机实现快速大语言模型冷启动

Yitao Yuan, Yongchao He, Shaoke Fang, Wenfei Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理服务冷启动低效问题,提出通信有限自动机抽象及编程框架,经证明其正确性后应用于vLLM相关环节形成InstantInfer,大幅加速冷启动且在多场景表现鲁棒。

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17415 2026-07-21 cs.AR 新提交 85%

Transition-Aware Backend Dispatch for Edge LLM Inference

用于边缘大语言模型推理的过渡感知后端调度

Alaaddin Goktug Ayar, Martin Margala

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究边缘平台大语言模型推理问题,提出过渡感知后端调度方法,结合算子特征与后端选择,经实验验证该方法能降低延迟、能量及能量延迟积,减少切换,提升边缘变压器工作负载调度效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17498 2026-07-21 quant-ph 新提交 85%

LLM-Driven Cross-Paradigm Design for Quantum Optimal Control

基于大语言模型驱动的量子最优控制跨范式设计

Yu-Qin Chen, Shi-Xin Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11262 2026-07-14 cs.DC 新提交 85%

GPU-Tile-Sim: A Tile-Centric GPU Simulation Framework for LLM Hardware-Software Co-Design

GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架

Yitong Ding, Jiawei Huang, Renyang Guan, Yangjie Zhou, Zihan Liu, Yu Feng, Shixuan Sun, Mingyi Guo, Jingwen Leng, Jian Weng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。

Comments 14 pages, 14 figures. Accepted to MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08116 2026-07-10 cs.NI 新提交 85%

MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling

MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务

Guanchen Liu, Hongyang Du, Kaibin Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07918 2026-07-10 cs.LG cs.AI cs.CL cs.CR 新提交 85%

Efficient Safety Alignment of Language Models via Latent Personality Traits

通过潜在人格特质实现语言模型的高效安全对齐

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) McGill University(麦吉尔大学) LawZero Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。

Comments 15 pages, 6 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07046 2026-07-09 cs.DC 新提交 85%

Voltron: Enabling Elastic Multi-Device Execution of LLM Inference for Empowered Edge Intelligence

Voltron:实现用于增强型边缘智能的大语言模型推理的弹性多设备执行

Chanwoo Cho, Wooseok Kim, Yonglak Son, Young Seo Lee, Young Geun Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在解决大语言模型推理在集中式执行的局限,提出利用边缘多用户端设备的方法。核心方法是Voltron框架,能弹性利用多设备适应边缘环境。主要贡献是比单设备执行的模型精度高16.5%,满足用户QoS需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04302 2026-07-07 cs.LG cs.AI cs.AR cs.CL cs.PF 新提交 85%

HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference

HiFA4:用于大语言模型推理的昇腾HIF4 NPU上的免训练4位FlashAttention

Hui Dong, Yanzhao Li, Jie Gao, Chunlu Li, Zhiyuan Zhang, Yupeng Sun, Zhenyuan Chen, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiFA4是一种训练后算子级设计,在昇腾NPU上用4位HIF4 Cube GEMM执行QK^T和PV进行大语言模型推理,结合Smooth-QK和P-Reordering机制,减少量化决策漂移,提升准确率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏