arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22210 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22210 篇

2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 89%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18331 2026-07-14 cs.LG 版本更新 89%

Prune, Update and Trim: Robust Structured Pruning for Large Language Models

剪枝、更新与裁剪:大型语言模型的鲁棒结构剪枝

Diego Coello de Portugal Mecke, Tom Hanika, Lars Schmidt-Thieme

机构 * ISMLL & DARC VWFS University of Hildesheim(ISMLL与DARC VWFS大学海德斯海姆大学) ISMLL University of Hildesheim(ISMLL大学海德斯海姆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出Putri方法,通过更新未剪枝权重、按顺序剪枝FFN层以及移除单个注意力头来改进大型语言模型的后训练剪枝,实现了在极端稀疏率下的高效剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 89%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04013 2026-07-13 cs.CL 版本更新 89%

AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving

AugServe:用于增强型大语言模型推理服务的自适应请求调度

Ying Wang, Zhen Jin, Jiexiong Xu, Wenhai Lin, Yiquan Chen, Wenzhi Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究针对增强型大语言模型推理服务效率问题及现有系统挑战,提出AugServe框架,采用两阶段自适应请求调度策略并动态调整令牌批处理机制,有效提升了有效吞吐量并减少首次令牌时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 89%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-07-07 cs.AI cs.NE 新提交 89%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments A First draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04290 2026-07-07 cs.NI cs.AI 新提交 89%

Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理

Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios Kanavos

机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。

Comments 20 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02391 2026-07-03 cs.DC cs.LG 新提交 89%

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU: 在未见过的GPU和LLM上预测推理功耗和延迟

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

机构 * Universidad Politécnica de Madrid(马德里理工大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出WattGPU模型,利用公开的LLM元数据和GPU规格,无需硬件访问即可预测平均GPU功耗和令牌间延迟,在未见过的GPU和LLM上误差低至3.4%,优于基线方法。

Comments Accepted at 1st Workshop on Sustainability and Resource-Efficiency of Artificial Intelligence @ IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28962 2026-06-30 cs.CR cs.LG 89%

FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

FlipGuard:防御针对大型语言模型的量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Suzhou Research Institute of Shandong University(山东大学苏州研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出FlipGuard防御框架,通过量化前扰动权重打破后门触发条件,有效抑制量化条件后门攻击,并引入DER指标统一评估安全、效用与成本。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25558 2026-06-29 cs.AI 89%

Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching

超越查询记忆化:基于查询分解和历史匹配的大语言模型路由

Bo Lv, Jingbo Sun

机构 * Tencent Hunyuan(腾讯文言) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出DecoR路由框架,通过查询能力分解和历史日志匹配来避免记忆化陷阱,在保持高准确率的同时降低推理成本。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24077 2026-06-24 cs.CL 新提交 89%

Sentence-Level Contextual Entrainment in Large Language Models

大型语言模型中的句子级上下文嵌入

Yang Liu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 研究大型语言模型中句子级上下文嵌入现象,发现提示中的句子(包括反事实陈述)会显著增加其推理概率,且该现象随模型增大而减弱,通过关闭2%-4%的注意力头可缓解而不影响性能。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14117 2026-06-24 cs.NI cs.AI 版本更新 89%

Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management

迈向自主O-RAN:一种用于实时网络控制与管理的多尺度智能体AI框架

Hojjat Navidan, Mohammad Cheraghinia, Jaron Fontaine, Mohamed Seif, Eli De Poorter, H. Vincent Poor, Ingrid Moerman, Adnan Shahid

机构 * IDLab, Department of Information Technology at Ghent University - imec(IDLab,格鲁特大学信息科技系 - imec) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种多尺度智能体AI框架,通过非实时、近实时和实时控制环的协调层次结构,实现O-RAN的自主网络控制与管理,并在非平稳条件下和意图驱动的切片资源控制场景中验证了其有效性。

Comments Accepted for publication in the IEEE Network magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20590 2026-06-23 cs.NI cs.AI 新提交 89%

Optimization-as-a-Service via Multi-Agent Large Language Model for Radio Access Networks

通过多智能体大语言模型实现无线接入网的优化即服务

Chaoqun You, Yueyue Dai, Xingqiu He, Yue Gao, Rahim Tafazolli, Yong Liang Guan

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) University of Surrey(Surrey大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出将物理资源块分配问题作为大语言模型多智能体系统提供的优化即服务,通过场景理解、目标生成、求解器和反思智能体实现上下文感知的自校正公式,并引入单次反思蒸馏机制降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00024 2026-06-17 cs.CL 版本更新 89%

ART: Attention Run-time Termination for Efficient Large Language Model Decoding

ART:面向高效大语言模型解码的注意力运行时终止

Chen Qiu, Guozhong Li, Cristian McGee, Aritra Dutta, Panos Kalnis

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) University of Central Florida(中央佛罗里达大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 提出注意力运行时终止(ART)机制,通过跟踪累积注意力输出并在贡献可忽略时终止后续KV块访问,在不显著影响准确率的情况下将大批量生成吞吐量提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06694 2026-06-16 cs.LG 版本更新 89%

NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models

NanoQuant: 大型语言模型高效子1位量化

Hyochan Chong, Dongkyu Kim, Changdong Kim, Minseop Choi

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出NanoQuant,一种新型后训练量化方法,能够将大型语言模型压缩到二进制和子1位水平,通过低秩二进制分解问题实现高效压缩,并在消费者硬件上实现大规模部署。

Comments Accepted to ICML 2026. Hyochan Chong and Dongkyu Kim contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14347 2026-06-15 cs.LG 新提交 89%

When Language Representations Interact: Separability and Cross-Lingual Effects in LLMs

当语言表示交互时:LLM中的可分离性与跨语言效应

Boris Marinov, Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Oxford(牛津大学) Imperial College London(帝国理工学院) University of York(约克大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过因果几何分析,研究多语言LLM中语言表示的线性可分离性及跨语言结构依赖,发现语言概念在协方差调整内积下可分离,同语系语言呈现单纯形几何结构。

Comments Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04349 2026-06-08 cs.CV cs.AI 版本更新 89%

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models

MorphoQuant: 面向全模态大语言模型的模态感知量化

Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

机构 * institutetext: MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models Yue Wu Changyuan Wang Zixuan Wang Shilin Ma Yansong Tang(机构文本:MorphoQuant:多模态大语言模型的模态感知量化 Yue Wu 王昌元 王梓轩 马世林 唐彦松)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 提出MorphoQuant框架,通过分布感知偏差补偿和形态导向量化函数优化,解决全模态大语言模型在4比特后训练量化中的分布异质性和异常值问题,实现精度与效率的优异平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03098 2026-06-03 cs.CL 89%

Privacy-Aware Decoding: Mitigating Privacy Leakage of Large Language Models in Retrieval-Augmented Generation

隐私感知解码:缓解检索增强生成中大语言模型的隐私泄露

Haoran Wang, Xiongxiao Xu, Baixiang Huang, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 提出一种轻量级推理时防御方法PAD,通过在解码过程中注入校准高斯噪声,结合置信度筛选、敏感度估计和上下文感知噪声校准,在RAG系统中平衡隐私保护与生成质量,并利用Rényi差分隐私跟踪累积隐私损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02288 2026-06-02 cs.LG 89%

Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

LLM中的大规模尖峰是偏置向量:机制揭示与无尖峰量化

Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou, Naveen Verma

机构 * Princeton University(普林斯顿大学) EnCharge AI

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过机制分析发现LLM中的激活尖峰本质上是结构化的向量偏置,并提出无尖峰量化框架INSERTQUANT,实现鲁棒的低比特量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05795 2026-05-26 cs.LG 89%

Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs

使用行为树和LLM的组合任务奖励塑造与动作掩码

Nicholas Potteiger, Ankita Samaddar, Taylor T. Johnson, Xenofon Koutsoukos

机构 * Vanderbilt University(范德比大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MRBT结构,结合LLM自动生成奖励和动作掩码,通过SMT验证和神经符号RL循环,提升组合任务训练效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09130 2026-05-26 cs.LG 89%

UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation

UniComp: 通过剪枝、量化和蒸馏对大型语言模型压缩的统一评估

Jonathan von Rad, Yong Cao, Andreas Geiger

机构 * University College London(伦敦大学学院) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出UniComp框架,统一评估剪枝、量化和知识蒸馏三种压缩方法,从性能、可靠性和效率三个维度在40个数据集上分析,发现知识偏差、性能与可靠性解耦以及任务特定校准可提升推理性能。

Comments 18 pages, 5 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22078 2026-05-22 cs.AI cs.CV 89%

Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

通过无训练空间-时间池化和栅格化增强视频大语言模型的视觉令牌表示

Bingjun Luo, Tony Wang, Hanqi Chen, Xinpeng Ding

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Xidian University(西安电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出了一种无需训练的空间-时间池化和栅格化方法ST-GridPool,用于提升视频大语言模型的视觉令牌表示,通过多级时空交互和基于规范的空间池化技术,在不需重新训练的情况下提高性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05431 2026-05-20 cs.CL 89%

Self-Filtered Distillation with LLMs-generated Trust Indicators for Reliable Patent Classification

基于LLM生成信任指标的自过滤蒸馏用于可靠专利分类

Yongmin Yoo, Xu Zhang, Longbing Cao

机构 * Frontier AI Research Centre, School of Computing, Faculty of Science and Engineering, Macquarie University(前沿人工智能研究中心,计算机学院,科学与工程学院,麦考瑞大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自过滤蒸馏方法,通过将LLM生成的推理作为信任指标而非真实标签,提升专利分类的可靠性,实验显示在USPTO-2M数据集上宏F1指标提升了38.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22056 2026-05-19 cs.CL 89%

Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch

双空间知识蒸馏与关键-查询匹配用于具有词汇不匹配的大型语言模型

Stella Eva Tsiapali, Cong-Thanh Do, Kate Knill

机构 * University of Cambridge, Department of Engineering(剑桥大学工程系) Toshiba Europe Limited(东芝欧洲有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文研究了针对具有词汇不匹配的大型语言模型的双空间知识蒸馏与关键-查询匹配方法,通过分析注意力机制揭示其优缺点,并提出基于生成对抗学习的新方法以解决关键-查询分布不匹配问题。

Comments Copyright 2026 IEEE. Published in ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 4-8 May 2026 in Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17288 2026-05-19 cs.CR cs.AI 89%

When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

效率反噬:对抗攻击下级联LLM引发级联故障

Zehan Sun, Dingfan Chen, Songze Li

机构 * Southeast University(东南大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了级联LLM系统在对抗攻击下的脆弱性,提出了一种新的攻击框架,通过约束序列协同优化对抗后缀,在级联依赖下同时利用轻量级模型和决策机制,验证了此类攻击的有效性和严重性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16758 2026-05-19 cs.CL 89%

Language Acquisition Device in Large Language Models

大型语言模型中的语言习得装置

Masato Mita, Taiga Someya, Ryo Yoshida, Yohei Oseki

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出了一种受语言习得装置启发的预预训练方法,通过在MP-STRUCT形式语言上进行预训练,提高了大型语言模型的数据效率,并展示了其对结构不合理的语言的抗性。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04163 2026-05-18 cs.LG 89%

BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models

BPDQ:基于可变网格的位平面分解量化用于大语言模型

Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen Li, Taiqiang Wu, Mengzhao Chen, Zhen Peng, Chaofan Tao, Long Shi, Hongxia Yang, Ngai Wong

机构 * Southwestern University of Finance and Economics(西南财经大学) The University of Hong Kong(香港大学) Artificial Intelligence and Digital Finance Key Laboratory of Sichuan Province(四川省人工智能与数字金融重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出BPDQ,通过位平面和标量系数构建可变量化网格,并利用二阶信息迭代优化,实现2位下大语言模型在单张RTX 3090上达到83.85%的GSM8K准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07182 2026-05-11 cs.LG 89%

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic:多模型一体的推理LLM及其高效预算控制

Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Star Elastic方法,通过单次训练任务添加多个嵌套子模型,降低训练成本并解决静态架构的刚性问题,实现动态预算控制,提升推理准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01627 2026-05-08 cs.LG 89%

Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models

基于重要性的基选择用于大型语言模型的低秩分解

Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出BSI框架,通过估计移除每个基所导致的损失增加来选择和剪枝基,提升低秩分解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19398 2026-04-22 cs.AI 89%

GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models

GRASPrune:基于预算的大型语言模型结构剪枝的全局门控

Ziyang Wang, Jiangfeng Xiao, Chuan Xiao, Ruoxiang Li, Rui Mao, Jianbin Qin

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen University(深圳大学) Osaka University(大阪大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 GRASPrune通过全局预算约束联合剪枝FFN通道和KV头部组,采用轻量门分数学习和投影直通估计器,在保持模型权重冻结的情况下实现高效剪枝,并通过校准缩放因子提升推理性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏