arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22243 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22243 篇

2607.00501 2026-07-02 cs.CL cs.AI cs.PF 新提交 89%

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

BaseRT: 通过原生Metal在Apple Silicon上实现最佳LLM推理

Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

机构 * Base Compute, Melbourne, Australia(Base Compute,墨尔本,澳大利亚)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于原生Metal的推理运行时BaseRT,通过芯片特定内核融合、统一内存感知优化和自定义调度逻辑,在Apple Silicon上实现最高推理吞吐量,相比现有框架提升高达1.56倍解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27785 2026-06-29 cs.CL cs.AI 新提交 89%

Output-Space Allocation Costs for Calibration-Guided LLM Compression: An Empirical Study

校准引导的LLM压缩中输出空间分配成本的实证研究

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究ROCKET方法中分配成本与输出空间目标对齐对压缩模型保真度的影响,发现存在准确率-困惑度权衡,且成本函数影响随压缩率降低而减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26587 2026-06-26 cs.LG cs.AI 新提交 89%

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ:桥接激活稀疏性与FP4量化用于LLM推理

Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Huaqing Zheng, Xindian Ma, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 89%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23277 2026-06-15 cs.CL cs.AI 版本更新 89%

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression

Sentinel: 通过注意力探测解码上下文利用以实现高效LLM上下文压缩

Yong Zhang, Heng Li, Yanwen Huang, Ning Cheng, Yang Guo, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

机构 * Ping An Technology (Shenzhen) Co., Ltd., China(平安科技(深圳)有限公司,中国) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Sentinel,一种轻量级句子级压缩框架,通过冻结LLM的头部注意力模式解码推理时上下文利用行为,使用单次非自回归前向传递实现压缩,在LongBench上以0.5B代理模型达到5倍压缩且性能与7B模型方法相当。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10706 2026-06-10 cs.LG cs.AI 新提交 89%

Unifying Data, Memory, and Compute Efficiency in LLM training: A Survey

统一LLM训练中的数据、内存和计算效率:一项综述

Vanessa Schmidt, Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Anke Schmeink

机构 * Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席) AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation and Control Institute, Technische Universität Wien (TUW)(维也纳工业大学自动化与控制研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从资源约束视角综述大语言模型训练中的数据效率、内存效率和计算预算感知三大瓶颈,强调三者需联合优化而非孤立处理。

Comments Accpeted for publication in IEEE Transactions on Artificial Intelligence (TAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10445 2026-06-10 cs.LG cs.CL 新提交 89%

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

SpenseGPT: 面向LLM推理的实用一次性剪枝,支持稀疏和稠密GEMM

Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究) Seoul National University(首尔大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出Spense混合稀疏-稠密格式,将权重矩阵分为2:4稀疏和稠密区域,结合一次性剪枝方法SpenseGPT,在B200 GPU上实现高达1.2倍端到端解码加速,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10294 2026-06-10 cs.LG cs.AI cs.AR cs.NE physics.comp-ph 新提交 89%

LLM-Guided Neural Architecture Search for Robust Co-Design of Physical Neural Networks

LLM引导的神经架构搜索用于物理神经网络的鲁棒协同设计

Tyler King, Timothee Leleu

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UH-NAS框架,利用大语言模型作为进化算子,协同优化任务准确率和推理能耗,实现跨硬件平台的公平比较,在光学MZI硬件上发现更鲁棒的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI 89%

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00615 2026-06-02 cs.AI cs.CL 89%

ACON: Optimizing Context Compression for Long-horizon LLM Agents

ACON:面向长周期LLM智能体的上下文压缩优化

Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ACON框架,通过自然语言空间优化压缩策略,在不微调模型的情况下减少峰值token使用量26-54%并提升任务成功率,同时可蒸馏至小模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 89%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07775 2026-05-11 cs.LG cs.AI stat.ML 89%

POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles

POETS: 通过计算高效的策略集合实现不确定性感知的LLM优化

Nicolas Menet, Andreas Krause, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士苏黎世实验室) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 POETS通过计算高效的策略集合,结合KL正则化和策略优化,实现了在序列决策和黑箱优化中的不确定性量化,提升了样本效率和优化轨迹。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23198 2026-05-11 cs.LG cs.CL 89%

Sparser, Faster, Lighter Transformer Language Models

更稀疏、更快、更轻量的Transformer语言模型

Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones

机构 * Sakana AI NVIDIA

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);foundation model(abstract)

AI总结 本文提出一种基于无结构稀疏性的方法,通过改进的稀疏打包格式和CUDA内核,提升Transformer模型的推理和训练效率,实现更高效的模型压缩与资源利用。

Comments Code and checkpoints available at: https://github.com/SakanaAI/sparser-faster-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25426 2026-05-05 cs.CL cs.AI 89%

Implicature in Interaction: Understanding Implicature Improves Alignment in Human-LLM Interaction

互动中的隐含意义:理解隐含意义能提高人-大语言模型互动的对齐

Asutosh Hota, Jussi P. P. Jokinen

机构 * Jyvaskylan yliopisto(耶夫斯克扬大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在基于上下文的提示中推断用户意图的能力,发现更大模型更接近人类解释,隐含意义提示能显著提升响应的相关性和质量,67.6%参与者偏好隐含意义提示。

Comments The manuscript is approximately 7360 words and contains 12 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00422 2026-05-04 cs.LG cs.AI 89%

BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs

BWLA: 突破 W1AX 事后训练量化在 LLMs 中的障碍

Zhixiong Zhao, Zukang Xu, Dawei Yang

机构 * Houmo AI

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出 BWLA 框架,通过 1 位权重量化和 6 位低精度激活实现 LLMs 的高效压缩与加速,显著提升性能并降低计算成本。

Comments Accepted by ACL-Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11786 2026-04-29 cs.LG cs.AI 89%

Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing

通过加速提示压力测试评估LLM在重复推理下的安全性

Keita Broadwater

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APST框架,通过重复推理测试揭示模型在持续使用下的失败模式,展示单次评估无法反映实际可靠性差异。

Comments 23 pages, 9 figures; editorial and LaTeX revisions for clarity; improved presentation of methodology and results; updated figures, tables, and float placement; clarified temperature sensitivity and deployment-risk analysis; expanded reporting from the same experiments; results unchanged in substance

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22166 2026-04-27 cs.LG cs.AI 89%

Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches

通过基准测试轻量级后训练稀疏化方法来推动下一代加速器的灵活(N:M)激活稀疏化

Shirin Alanova, Kristina Kazistova, Ekaterina Galaeva, Alina Kostromina, Vladimir Smirnov, Redko Dmitry, Alexey Dontsov, Maxim Zhelnin, Evgeny Burnaev, Egor Shvetsov

机构 * Applied AI(应用人工智能) Artificial Intelligence Research Institute(人工智能研究所) HSE University(俄罗斯高等经济大学) Sb AI Lab(Sb人工智能实验室) MWS AI(MWS人工智能) Yandex Independent Researcher(独立研究者)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过基准测试轻量级后训练稀疏化方法,探讨了灵活(N:M)激活稀疏化在大语言模型中的应用,展示了激活稀疏化在保持生成能力方面的优势,并提出了适用于未来硬件的稀疏化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20079 2026-04-23 cs.LG cs.CL 89%

On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks

扩散语言模型在编码基准中的量化鲁棒性研究

Aarav Gupta, Gururaj Deshpande, Chandreyi Chakraborty

机构 * College of Computing(计算机学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 本文研究了扩散语言模型在量化后的鲁棒性,发现CoDA在低比特宽度下比Qwen3-1.7B更稳健,且混合精度配置在精度、延迟和内存间提供平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18592 2026-04-22 cs.CL cs.AI 89%

Two-dimensional early exit optimisation of LLM inference

二维早退优化大语言模型推理

Jan Hůla, David Adamczyk, Tomáš Filip, Martin Pavlíček, Petr Sosík

机构 * Institute for Research and Applications of Fuzzy Modelling(模糊建模研究与应用研究所) University of Ostrava(奥斯特拉瓦大学) Institute of Computer Science(计算机科学研究所) Faculty of Philosophy and Science(哲学与科学学院) Silesian University in Opava(奥帕瓦西里西亚大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种二维早退策略,通过协调层间和句子间早退实现大语言模型分类任务的计算优化,实验表明在不同规模的LLM上能显著提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29078 2026-04-22 cs.CL cs.LG 89%

PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression

PolarQuant:通过Hadamard旋转实现最优高斯权重量化用于LLM压缩

Caio Vicentino

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 PolarQuant通过Hadamard旋转实现高斯分布的权重量化,显著降低压缩后的语言模型 perplexity,达到近无损压缩效果,并提升后续INT4量化性能。

Comments Found some errors, I need to fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16591 2026-04-21 cs.LG cs.AI 89%

Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning

随机抗双极搜索:为大语言模型反向学习的数据帕累托改进

Ziwen Liu, Huawei Lin, Yide Ran, Denghui Zhang, Jianwen Xie, Chuan Li, Weijie Zhao, Zhaozhuo Xu

机构 * Rice University(里士大学) Rochester Institute of Technology(罗切斯特理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Lambda

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出数据帕累托改进概念,通过随机抗双极搜索算法提升LLM反向学习的遗忘与保留平衡,实现高效高质量的反向学习解决方案。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14214 2026-04-17 cs.CL cs.AI 89%

CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization

CROP:通过正则化提示优化实现大语言模型的token高效推理

Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CROP通过正则化提示优化,在保持准确性的同时显著降低token消耗,适用于复杂推理任务。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14159 2026-04-17 cs.CL cs.AI 89%

HUOZIIME: An On-Device LLM-enhanced Input Method for Deep Personalization

HUOZIIME:一种基于大语言模型的设备端输入法用于深度个性化

Baocai Shan, Yuzhuang Xu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出HUOZIIME,一种基于大语言模型的设备端输入法,通过合成个性化数据训练基础模型,结合分层记忆机制实现高效个性化文本生成,实验表明其在设备端执行高效且个性化质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03044 2026-04-09 cs.CL cs.AI 89%

JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency

JoyAI-LLM Flash: 通过令牌效率推进中等规模语言模型

Aichen Cai, Anmeng Zhang, Anyu Li, Bo Zhang, Bohua Cai, Chang Li, Changjian Jiang, Changkai Lu, Chao Xue, Chaocai Liang, Cheng Zhang, Dongkai Liu, Fei Wang, Guoqiang Huang, Haijian Ke, Han Lin, Hao Wang, Ji Miao, Jiacheng Zhang, Jialong Shi, Jifeng Zhu, Jingjing Qian, Junhui Luo, Junwu Xiong, Lam So, Liang Huang, Ming Ke, Mingyang Li, Panfeng Shi, Peng Hao, Qi Wang, Qian Lai, Qiaoqiao Yuan, Qingyu Yin, Qiong Cao, Qixiang Wang, Rongcheng Bian, Rongduo Han, Shaoqiang Zheng, Shi Hu, Shi Suo, Shijie Ren, Shijin Zhang, Shiying Fan, Shuai Xie, Tianyi Zhang, Wei Liu, Wentao Tan, Xianghan Meng, Xiaodong He, Xing Pan, Xiran Wang, Xuyang Peng, Ya Zhang, Yang Liu, Yangyang Duan, Yanxu Chen, Yicheng Gong, Yidan Huang, Yifei Liu, Yinhao Bai, Yongqiang Liu, Yuesong Zhang, Yuqi Zhang, Zerui Xie, Zhenfang Wang, Zhennan Shen, Zheyuan Liu, Zhuwei Zeng

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出JoyAI-LLM Flash,一种高效的混合专家语言模型,通过平衡性能与令牌效率,在50B参数以下的范围内重新定义性能与效率的权衡。

Comments Xiaodong He is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 89%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07423 2025-11-12 cs.DC cs.AI cs.LG 89%

Synera: Synergistic LLM Serving across Device and Cloud at Scale

Genglin Wang, Liekang Zeng, Bufang Yang, Kaiwei Liu, Guoliang Xing, Chumin Sun, Li Zhou, Jie Sun, Zhenyu Yan

机构 * The Chinese University of Hong Kong Hong Kong SAR China(香港中文大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co. Ltd.(理论实验室、中央研究院、2012实验室、华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16252 2025-07-23 cs.CL cs.AI 89%

Efficient RL for optimizing conversation level outcomes with an LLM-based tutor

Hyunji Nam, Omer Gottesman, Amy Zhang, Dean Foster, Emma Brunskill, Lyle Ungar

机构 * Stanford University(斯坦福大学) Amazon(亚马逊公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07832 2025-02-13 cs.LG cs.AI 89%

SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters

Yiping Wang, Hanxian Huang, Yifang Chen, Jishen Zhao, Simon Shaolei Du, Yuandong Tian

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18779 2024-10-25 cs.LG cs.CL 89%

A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs

Ankit Singh Rawat, Veeranjaneyulu Sadhanala, Afshin Rostamizadeh, Ayan Chakrabarti, Wittawat Jitkrittum, Vladimir Feinberg, Seungyeon Kim, Hrayr Harutyunyan, Nikunj Saunshi, Zachary Nado, Rakesh Shivanna, Sashank J. Reddi, Aditya Krishna Menon, Rohan Anil, Sanjiv Kumar

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18287 2024-10-25 cs.CL cs.LG 89%

LEGO: Language Model Building Blocks

Shrenik Bhansali, Alwin Jin, Tyler Lizzo, Larry Heck

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏