arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2603.01875 2026-07-20 cs.CL cs.AI cs.LG 版本更新 91%

KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models

KDFlow:一种用户友好且高效的大型语言模型知识蒸馏框架

Songming Zhang, Xue Zhang, Tong Zhang, Bojie Hu, Yufeng Chen, Jinan Xu

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输联合实验室,(北京交通大学)教育部) School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(计算机科学与技术学院,北京交通大学,北京,中国) Tencent Inc, China(腾讯公司,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 KDFlow通过解耦架构和SGLang实现高效蒸馏,平衡通信成本与性能,实现1.44至6.36倍加速。

Comments 9 pages, 4 figures, 4 tables, code is available at: https://github.com/songmzhang/KDFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08776 2026-07-13 cs.LG cs.AI cs.CL cs.GT 新提交 91%

A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions

一种通过交互解释大语言模型知识蒸馏的统一方法

Qingzhuo Wang, Ruiyang Qin, Zhenxin Qin, Wen Shen, Zhihua Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型知识蒸馏有效性背后机制,提出统一方法,通过交互分解输出分数,发现共同机制是交互稀疏化,不同方法性能差异源于处理复杂交互能力,进而提出CIP损失函数,实验证明其能提升多种KD方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08057 2026-07-10 cs.LG cs.AI cs.CL 新提交 91%

Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

迈向高效大语言模型服务:关于系统感知键值缓存优化的综述

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该综述聚焦大语言模型服务中系统感知的键值缓存优化,从执行与调度、放置与迁移、表示与保留三个维度回顾相关工作,分析跨行为协同设计及行为与目标联系,为理解和创新键值缓存设计提供基础。

Comments Accepted to ACL 2026 as a Findings paper

Journal ref Findings of the Association for Computational Linguistics: ACL 2026 (pp. 38450-38476)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13820 2026-05-28 cs.LG cs.AI cs.CL 91%

Structured Agent Distillation for Large Language Model

大型语言模型的结构化智能体蒸馏

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue Lin, Dong Huang, Yanzhi Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) MIT(麻省理工学院) Northeastern University(东北大学) Adobe Research(Adobe研究) National University of Singapore(新加坡国立大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。

Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06597 2026-05-22 cs.CL cs.AI cs.LG 91%

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

UniSD:面向大语言模型的统一自蒸馏框架

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo, Haoxin Liu, B. Aditya Prakash, Josiah Hester, Jindong Wang, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出UniSD框架,系统研究自蒸馏方法,通过整合多种机制提升监督可靠性、表征对齐和训练稳定性,从而在多个基准和模型上验证自蒸馏的有效性,并构建出性能最优的UniSDfull流水线。

Comments Website: https://unifiedsd.github.io/ Code: https://github.com/Ahren09/UniSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16359 2026-05-21 cs.SE 91%

LLM4Log: A Systematic Review of Large Language Model-based Log Analysis

LLM4Log: 大型语言模型基于日志分析的系统综述

Zeyang Ma, Jinqiu Yang, Tse-Hsun Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文系统综述了基于大型语言模型的日志分析,涵盖从日志生成维护到解析结构化及下游任务如异常检测、故障预测、根本原因分析和日志摘要的全流程,总结了常见设计模式和评估实践,并指出可靠实际应用中的关键挑战和开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01143 2026-05-14 cs.DC 91%

HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware

HexiScale:在异构硬件上促进大语言模型训练

Ran Yan, Youhe Jiang, Xiaonan Nie, Fangcheng Fu, Bin Cui, Binhang Yuan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出HexiScale系统,通过异构GPU实现训练计算的灵活分配,提升资源利用效率,实验显示其在不同规模LLM训练中性能优于传统同构和异构系统。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22411 2026-04-27 cs.AI cs.CL cs.LG 91%

Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models

引入背景温度以表征大语言模型中的隐藏随机性

Alberto Messina, Stefano Scotta

机构 * RAI - Radiotelevisione Italiana, Centre for Research, Technological Innovation and Experimentation (CRITS)(意大利广播电视台,研究中心、技术创新与实验中心(CRITS))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文引入背景温度概念,探讨大语言模型中隐藏随机性的来源,提出通过有效温度评估实现依赖扰动,并通过实验验证其对可重复性、评估和部署的影响。

Journal ref Transactions on Machine Learning Research (TMLR), February 2026, https://openreview.net/pdf?id=bz0he4bARF

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15229 2026-04-21 cs.CL cs.AI cs.LG 91%

VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models

VocabTailor: 小语言模型下游任务中的动态词汇选择

Hanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Infinigence AI Tsinghua University(清华大学) SLAI Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 VocabTailor通过动态词汇选择框架减少小语言模型词汇相关组件的内存使用,结合静态与动态策略,实现高达99%的内存节省且不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04131 2026-01-13 cs.CL cs.AI cs.LG 91%

ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models

ContextFocus:用于大语言模型中上下文忠实性的激活引导

Nikhil Anand, Shwetha Somasundaram, Anirudh Phukan, Apoorv Saxena, Koyel Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ContextFocus通过轻量级激活引导方法提升大语言模型在知识冲突场景下的上下文忠实性,无需微调且高效,实验表明其在ConFiQA基准上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09854 2025-12-04 cs.CL cs.AI cs.LG 91%

Scaling Multimodal Search and Recommendation with Small Language Models via Upside-Down Reinforcement Learning

通过倒置强化学习扩展小语言模型以支持多模态搜索与推荐

Yu-Chen Lin, Sanat Sharma, Hari Manikandan, Jayant Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe(Adobe公司) Meta

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文通过倒置强化学习和合成数据蒸馏,利用小语言模型实现高效多模态搜索与推荐,显著降低推理延迟和内存开销。

Comments Accepted by ICDM 2025 MMSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03460 2025-11-17 cs.LG cs.AI cs.CL 91%

Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training

Rui Pan, Shivanshu Shekhar, Boyao Wang, Shizhe Diao, Jipeng Zhang, Xingyuan Pan, Renjie Pi, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) HKUST(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15857 2025-11-11 cs.CL cs.AI cs.LG 91%

PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation

Tao Fan, Guoqiang Ma, Yuanfeng Song, Lixin Fan, Qiang Yang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) WeBank Co., Ltd(WeBank公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08825 2025-10-07 cs.CL cs.AI cs.LG 91%

Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation

Joachim Baumann, Paul Röttger, Aleksandra Urman, Albert Wendsjö, Flor Miriam Plaza-del-Arco, Johannes B. Gruber, Dirk Hovy

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01976 2025-09-11 cs.CL cs.AI cs.LG cs.PF 91%

CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing

Wenhao Zheng, Yixiao Chen, Weitong Zhang, Souvik Kundu, Yun Li, Zhengzhong Liu, Eric P. Xing, Hongyi Wang, Huaxiu Yao

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Intel(英特尔) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·拉希德人工智能大学) Rutgers University(罗格斯大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17968 2025-05-26 cs.LG cs.AI cs.CL 91%

Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems

Jiayi Geng, Howard Chen, Dilip Arumugam, Thomas L. Griffiths

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13840 2025-05-21 cs.CL cs.AI cs.LG 91%

EfficientLLM: Efficiency in Large Language Models

Zhengqing Yuan, Weixiang Sun, Yixin Liu, Huichi Zhou, Rong Zhou, Yiyang Li, Zheyuan Zhang, Wei Song, Yue Huang, Haolong Jia, Keerthiram Murugesan, Yu Wang, Lifang He, Jianfeng Gao, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱斯大学) Imperial College London(伦敦帝国理工学院) Rutgers University(罗格斯大学) International Business Machines Corporation (IBM)(国际商业机器公司(IBM)) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft Research(微软研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01496 2025-05-08 cs.CL cs.AI cs.LG 91%

Liger: Linearizing Large Language Models to Gated Recurrent Structures

Disen Lan, Weigao Sun, Jiaxi Hu, Jusen Du, Yu Cheng

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Accepted by ICML 2025, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21311 2025-05-01 cs.NI 91%

Covert Prompt Transmission for Secure Large Language Model Services

Ruichen Zhang, Yinqiu Liu, Shunpu Tang, Jiacheng Wang, Dusit Niyato, Geng Sun, Yonghui Li, Sumei Sun

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06126 2024-12-13 cs.CL cs.AI cs.LG 91%

Learn To be Efficient: Build Structured Sparsity in Large Language Models

Haizhong Zheng, Xiaoyan Bai, Xueshen Liu, Z. Morley Mao, Beidi Chen, Fan Lai, Atul Prakash

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

Journal ref Advances in Neural Information Processing Systems (NeurIPS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18987 2024-10-01 cs.CL cs.AI cs.CY cs.LG 91%

Efficient and Personalized Mobile Health Event Prediction via Small Language Models

Xin Wang, Ting Dang, Vassilis Kostakos, Hong Jia

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02891 2024-07-04 cs.LG cs.AI cs.CL 91%

GPTQT: Quantize Large Language Models Twice to Push the Efficiency

Yipin Guo, Yilin Lang, Qinyuan Ren

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments Accepted by 11th IEEE International Conference on Cybernetics and Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17289 2026-06-09 cs.LG cs.AI 版本更新 91%

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

LEAP:可学习的端到端无结构剪枝大型语言模型

Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

机构 * University of Maryland(马里兰大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出LEAP,一种可学习的端到端无结构剪枝方法,通过伯努利-戈姆贝茨松弛替代传统参数化,提高了无结构剪枝的端到端准确率,实验表明在多个LLM家族上平均提升了零样本准确率。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06098 2026-06-05 cs.CL cs.LG 91%

IR3DE: A Linear Router for Large Language Models

IR3DE:面向大型语言模型的线性路由器

Eros Fanì, Oğuzhan Ersoy

机构 * Gensyn

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出基于岭回归的线性路由器IR3DE,以低成本快速为每个提示选择最合适的领域专家大语言模型,在推理任务中超越基线方法,并支持动态添加或移除专家模型。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12397 2024-07-18 cs.LG cs.AI cs.NE 91%

Mamba-PTQ: Outlier Channels in Recurrent Large Language Models

Alessandro Pierro, Steven Abreu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract,comments);post-training(abstract)

Comments Work presented at the Efficient Systems for Foundation Models Workshop @ ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02834 2024-06-25 cs.LG cs.CL 91%

Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods

Bo-Kyeong Kim, Geonmin Kim, Tae-Ho Kim, Thibault Castells, Shinkook Choi, Junho Shin, Hyoung-Kyu Song

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract,comments);LLM(abstract)

Comments Update (arXiv-v2): continued pretraining for severe pruning ratios, compatibility with quantization, and enhanced baselines. Preliminary work (arXiv-v1) accepted at ICLR 2024 Workshop on ME-FoMo: https://openreview.net/forum?id=18VGxuOdpu

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14543 2023-11-27 cs.CL cs.AI 91%

Data-Efficient Alignment of Large Language Models with Human Feedback Through Natural Language

Di Jin, Shikib Mehri, Devamanyu Hazarika, Aishwarya Padmakumar, Sungjin Lee, Yang Liu, Mahdi Namazifar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments Accepted by Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023, Submitted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17062 2026-08-11 cs.CR cs.LG cs.SE 版本更新 91%

The Range Shrinks, the Threat Remains: Re-evaluating LLM Package Hallucinations on the 2026 Frontier-Model Cohort

范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉

Aleksandr Churilov

机构 * Anthropic OpenAI Google DeepSeek

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。

Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28048 2026-08-05 cs.AI 版本更新 91%

SKILL-KD: Contrastive Skill Distillation for LLM Agents

SKILL-KD:面向大语言模型智能体的对比式技能蒸馏

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan Zhou, Di Weng

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18553 2026-07-30 cs.LG cs.DS cs.IT math.IT 91%

The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm

LLM量化几何学:GPTQ作为Babai最近平面算法

Jiale Chen, Yalda Shabanzadeh, Elvir Crnčević, Torsten Hoefler, Dan Alistarh

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学技术院) Red Hat, Inc.(红帽公司) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文将GPTQ与Babai最近平面算法等价,揭示其几何意义和误差上界,设计出无裁剪的量化方法并提供高效GPU内核,为大规模模型量化理论奠定基础。

Comments Published as a conference paper at the Fourteenth International Conference on Learning Representations (ICLR 2026): https://openreview.net/forum?id=NFB4QGGS65

Journal ref International Conference on Learning Representations, 2026, pp. 122653-122695

详情

展开后加载摘要…

URL PDF HTML 收藏