arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2409.02026 2024-10-04 cs.LG cs.CL 91%

Foundations of Large Language Model Compression -- Part 1: Weight Quantization

Sean I. Young

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments Preprint. 17 pages, 4 figures, 5 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08092 2024-09-24 cs.LG cs.AI cs.DC 91%

A Survey of Resource-efficient LLM and Multimodal Foundation Models

Mengwei Xu, Wangsong Yin, Dongqi Cai, Rongjie Yi, Daliang Xu, Qipeng Wang, Bingyang Wu, Yihao Zhao, Chen Yang, Shihe Wang, Qiyang Zhang, Zhenyan Lu, Li Zhang, Shangguang Wang, Yuanchun Li, Yunxin Liu, Xin Jin, Xuanzhe Liu

专题命中 效率与部署 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03735 2024-08-08 cs.CV cs.AI cs.LG 91%

Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation

Jingjing Xie, Yuxin Zhang, Mingbao Lin, Liujuan Cao, Rongrong Ji

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11410 2024-06-19 cs.CL cs.AI 91%

HARE: HumAn pRiors, a key to small language model Efficiency

Lingyun Zhang, Bin jin, Gaojian Ge, Lunhui Liu, Xuewen Shen, Mingyong Wu, Houqian Zhang, Yongneng Jiang, Shiqi Chen, Shi Pu

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16057 2024-05-28 cs.CL cs.LG 91%

SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models

Xudong Lu, Aojun Zhou, Yuhui Xu, Renrui Zhang, Peng Gao, Hongsheng Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13551 2024-05-24 cs.LG cs.AI 91%

Large Language Models are Effective Priors for Causal Graph Discovery

Victor-Alexandru Darvariu, Stephen Hailes, Mirco Musolesi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13137 2024-03-19 cs.LG cs.CL 91%

OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models

Wenqi Shao, Mengzhao Chen, Zhaoyang Zhang, Peng Xu, Lirui Zhao, Zhiqian Li, Kaipeng Zhang, Peng Gao, Yu Qiao, Ping Luo

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments ICLR 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08761 2024-02-15 cs.CL cs.AI 91%

JAMDEC: Unsupervised Authorship Obfuscation using Constrained Decoding over Small Language Models

Jillian Fisher, Ximing Lu, Jaehun Jung, Liwei Jiang, Zaid Harchaoui, Yejin Choi

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Code is available at https://github.com/jfisher52/JAMDecoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13514 2024-02-02 cs.CL cs.LG 91%

Small Language Models Improve Giants by Rewriting Their Outputs

Giorgos Vernikos, Arthur Bražinskas, Jakub Adamek, Jonathan Mallinson, Aliaksei Severyn, Eric Malmi

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

Comments Accepted at EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13304 2024-01-17 cs.LG cs.CL 91%

QuIP: 2-Bit Quantization of Large Language Models With Guarantees

Jerry Chee, Yaohui Cai, Volodymyr Kuleshov, Christopher De Sa

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08303 2023-12-14 cs.CL cs.AI 91%

Efficient Toxic Content Detection by Bootstrapping and Distilling Large Language Models

Jiang Zhang, Qiong Wu, Yiming Xu, Cheng Cao, Zheng Du, Konstantinos Psounis

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05736 2023-12-07 cs.CL cs.LG 91%

LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models

Huiqiang Jiang, Qianhui Wu, Chin-Yew Lin, Yuqing Yang, Lili Qiu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14192 2023-10-24 cs.CL cs.AI 91%

PromptMix: A Class Boundary Augmentation Method for Large Language Model Distillation

Gaurav Sahu, Olga Vechtomova, Dzmitry Bahdanau, Issam H. Laradji

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to EMNLP 2023 (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14552 2023-10-24 cs.CL cs.AI 91%

Sources of Hallucination by Large Language Models on Inference Tasks

Nick McKenna, Tianyi Li, Liang Cheng, Mohammad Javad Hosseini, Mark Johnson, Mark Steedman

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02367 2026-04-06 cs.NI cs.CL 91%

Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment

评估小型语言模型用于前端路由:一个统一的基准和合成流量实验

Warren Johnson, Charles Lee

机构 * Plexor Labs(Plexor实验室) Project Autobots

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,comments);LLM(abstract)

AI总结 本文通过统一基准和合成流量实验,评估小型语言模型在前端路由中的性能,发现Qwen-2.5-3B在准确率、延迟和成本上表现优异,但整体仍存在准确率与延迟的平衡问题。

Comments 23 pages, 1 figure, 9 tables. Article 8 in the TAAC Research Series. Code and data: https://github.com/micoverde/plexor-slm-frontdoor-rct

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00625 2024-12-31 cs.LG 91%

Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models

Guangji Bai, Zheng Chai, Chen Ling, Shiyu Wang, Jiaying Lu, Nan Zhang, Tingwei Shi, Ziyang Yu, Mengdan Zhu, Yifei Zhang, Xinyuan Song, Carl Yang, Yue Cheng, Liang Zhao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);pretraining(abstract)

Comments GitHub repo: https://github.com/tiingweii-shii/Awesome-Resource-Efficient-LLM-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08485 2026-08-11 cs.AI cs.CL cs.LG 新提交 90%

HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails

HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形

Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

机构 * Hong Kong Baptist University(香港浸会大学) Guangdong Polytechnic Normal University(广东技术师范大学) Guangdong Institute of Digital Industry(广东数字产业研究院) The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。

Comments Preprint, August 2026. 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27081 2026-07-30 cs.AI cs.CL cs.CR cs.LG 新提交 90%

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本科技大学) EPFL(洛桑联邦理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16326 2026-07-21 cs.CV 新提交 90%

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)

AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。

Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01579 2026-07-03 cs.DC 新提交 90%

OmniPilot: An Uncertainty-Aware LLM Inference Advisor for Heterogeneous GPU Clusters

OmniPilot: 面向异构GPU集群的不确定性感知LLM推理顾问

D. Balamurugan, Thomas W. Bush

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OmniPilot,通过共形校准分位数成本模型和分布外弃权层,为异构GPU集群上的LLM服务选择最优配置,预测吞吐量MAPE为6.2%,top-1准确率95%。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31163 2026-07-02 cs.LG cs.AI cs.CL 新提交 90%

ComplianceGate: Classifier-Gated Multi-Tier LLM Routing for Inference in Regulated Industries

ComplianceGate: 分类器门控的多层LLM路由用于受监管行业的推理

Abhishek Dey

机构 * Independent AI Researcher, India(印度独立人工智能研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出分类器门控路由架构,在推理前评估查询复杂度和数据敏感性,将含PII的查询路由到本地端点,简单查询路由到小型模型,实现合规与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27205 2026-06-26 cs.SE 新提交 90%

Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair

更小的模型,意外的代价:LLM量化在自动程序修复中的权衡

Fernando Vallecillos-Ruiz, Giordano d'Aloisio, Max Hort, Luca Traini, Antinisca Di Marco, Leon Moonen

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)

AI总结 研究LLM量化在自动程序修复中的效果,发现量化虽减少内存但增加推理时间和能耗,且修复问题集差异大,权衡受模型架构和任务复杂度影响。

Comments Accepted for publication in the Research Papers Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26277 2026-06-26 cs.IR cs.AI cs.CE cs.CL cs.LG 新提交 90%

From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations

从点击到意图:基于LLM提炼分类法的跨平台会话嵌入用于金融服务推荐

Dianjing Fan, Yao Li, Kyaw Hpone Myint, Dwipam Katariya, Alexandre G. R. Day, Pranab Mohanty, Giri Iyengar

机构 * Capital One

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对金融服务中网页匿名浏览与移动端登录行为差异导致的意图信号利用不足问题,提出自监督Transformer编码会话嵌入与LLM提炼分类法生成可解释标签的双用途框架,在移动端首页排序和用户转化预测任务上显著提升性能。

Comments Dianjing Fan and Yao Li equally contributed to this work. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26105 2026-06-26 cs.CL cs.AI cs.LG 新提交 90%

Context Recycling for Long-Horizon LLM Inference

长程LLM推理的上下文回收

Derek Thomas

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09781 2026-06-23 cs.NE cs.AI cs.CL cs.LG 版本更新 90%

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

参数高效神经进化用于多样化大语言模型生成:通过提示嵌入进化实现质量-多样性优化

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QD-LLM框架,通过进化提示嵌入实现参数高效神经进化,提升大语言模型生成质量与多样性,实验显示其在多个基准测试中表现优异。

Comments 11 pages, 3 figures, 7 tables, 1 algorithm, 1 theorem. Accepted to GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17579 2026-06-17 cs.LG cs.AI cs.CL cs.SI 新提交 90%

LLM Features Can Hurt GNNs: Concatenation Interference on Homophilous Graph Benchmarks

LLM特征可能损害GNN:同配图基准上的拼接干扰

Zhongyuan Wang, Pratyusha Vemuri

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现将LLM特征通过纯输入拼接(而非联合训练)引入图神经网络时,会在同配基准上系统性地降低准确率,并提出了一个基于LLM单独判别性指标Delta_sig来预测拼接效果。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09927 2026-06-10 cs.LG cs.AI cs.CL 新提交 90%

Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

可训练平滑旋转变换与学习通道尺度用于LLM量化

Patrik Czakó, Gábor Kertész, Sándor Szénási

机构 * Doctoral School of Applied Informatics and Applied Mathematics, Obuda University(应用信息学与应用数学博士学校,奥布达大学) John von Neumann Faculty of Informatics, Obuda University(约翰·冯·诺伊曼信息学系,奥布达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对大语言模型量化中激活值量化困难的问题,提出基于分位数鲁棒的缩放策略和梯度优化的通道尺度学习,在W4A4量化下显著降低误差。

Comments 6 pages, 8 figures, 3 tables. Accepted to IEEE INES 2026 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27704 2026-05-28 cs.IR 90%

Joint Optimization of Relevance and Engagement in Multi-Task Ranking for E-Commerce with Efficient LLM Supervision

电子商务中多任务排序的相关性与参与度联合优化与高效LLM监督

Luming Chen, Jiaqi Xi, Raghav Saboo, Kenny Chi, Martin Wang, Sudeep Das, Danny Nightingale, Aditya Dodda, Elyse Winer, Akshad Viswanathan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一个生产级多任务排序系统,通过序数相关头与统一价值模型联合优化相关性和参与度,并利用微调轻量级LLM生成三级序数相关标签,显著提升语义对齐同时保持核心参与目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24938 2026-05-28 cs.LG cs.AI cs.CL 90%

Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning

重新思考层冗余:校准比搜索在LLM深度剪枝中更重要

Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim, Suin Cho, Woosang Lim, Sunwoo Lee

机构 * Neural Superintelligence Lab, MODULABS(神经超智能实验室,MODULABS) University of Southern California(南加州大学) Boston University(波士顿大学) Seoul National University(首尔国立大学) Inha University(inha大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实验发现,在大型语言模型深度剪枝中,校准配置对剪枝模式和性能的影响远大于搜索算法的选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14220 2026-05-15 cs.LG cs.AI cs.CL 90%

Diagnosing Training Inference Mismatch in LLM Reinforcement Learning

诊断LLM强化学习中的训练推断不匹配

Tianle Zhong, Neiwen Ling, Yifan Pi, Zijun Wei, Tianshu Yu, Geoffrey Fox, Peng Wu, Xiao Yu

机构 * ByteDance(字节跳动) The University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示LLM强化学习中训练与推断阶段的不匹配问题,通过VeXact实验显示微小数值差异可能导致训练崩溃,并提出缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏