arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22089 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22089 篇

2407.11534 2025-02-11 cs.LG cs.AI 92%

LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices

Jung Hyun Lee, Jeonghoon Kim, June Yong Yang, Se Jung Kwon, Eunho Yang, Kang Min Yoo, Dongsoo Lee

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments Accepted to the main conference at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07505 2024-10-11 cs.LG cs.AI 92%

CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression

Wenyuan Liu, Xindian Ma, Peng Zhang, Yan Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08721 2023-10-25 cs.CL cs.AI 92%

Batch Prompting: Efficient Inference with Large Language Model APIs

Zhoujun Cheng, Jungo Kasai, Tao Yu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments EMNLP 2023 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05926 2026-08-07 cs.NI cs.AI 新提交 92%

BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

BALANCE:无线边缘网络中的混合自回归-推测式大语言模型推理

Guanqiao Qu, Shuo Chen, Qian Chen, Kin K. Leung, Xianhao Chen

专题命中 效率与部署 :LLM(title,summary_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对边缘LLM推理的延迟-内存权衡问题,提出混合自回归-推测式框架BALANCE,通过多项式时间算法优化资源分配,提升了任务吞吐量与服务用户数。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03626 2026-08-05 cs.CR cs.AI cs.CY 新提交 92%

A Security-Oriented Lifecycle Model for Large Language Model Systems

面向大型语言模型系统的安全导向生命周期模型

Eleftherios Batzolis, George Drosatos, Vassilis Katsouros, Konstantinos Rantos

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。

Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00481 2026-08-04 cs.AI 新提交 92%

F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models

F-WANDA:用于大语言模型可持续部署的Fisher重加权后训练剪枝方法

Himanshu Mishra

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);large language model(title);LLM(abstract,abstract_cn)

AI总结 F-WANDA是WANDA的改进后训练剪枝方法,通过Fisher重加权分配保留预算,在LLAMA-2-7B上实现更优MMLU指标且能耗仅为SPARSEGPT的1/3,处于性能与剪枝成本的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 92%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 效率与部署 :LLM(title_cn,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17165 2026-06-24 stat.ME cs.AI econ.EM math.ST stat.TH 新提交 92%

Statistical Foundations of LLM-based A/B Testing: A Surrogacy Framework for Human Causal Inference

基于LLM的A/B测试的统计基础:用于人类因果推断的替代指标框架

Joel Persson, Mårten Schultzberg, Sebastian Ankargren

机构 * Spotify USA, Inc.(Spotify美国公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出替代指标理论框架,证明在弱于分布等价条件下,校准LLM输出可识别平均处理效应,并分析随机性带来的偏差与方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23248 2026-06-11 cs.AI cs.NI 版本更新 92%

Resource-Aware LLM Reasoning for Mobile Edge General Intelligence

面向移动边缘通用智能的资源感知LLM推理

Mingyi Luo, Ruichen Zhang, Xiangwang Hou, Jun Du, Chunxiao Jiang, Yong Ren, Shiwen Mao

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院,清华大学,深圳) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing 和数据科学学院,新加坡) Department of Electronic Engineering, Tsinghua University, Beijing(清华大学电子工程系,北京) State Key Laboratory of Space Network and Communications, Tsinghua University, Beijing(空间网络与通信国家重点实验室,清华大学,北京) Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing(北京信息科学与技术国家研究中心,清华大学,北京) Department of Electrical and Computer Engineering, Auburn University, Auburn, USA(阿伯丁大学电气与计算机工程系,阿伯丁,美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出联合优化框架,通过自适应CoT提示和分布式MoE架构协同优化推理深度、专家激活和传输功率,在资源受限的移动边缘环境中实现LLM高效推理,推理质量与资源效率平衡,额外推理时间小于1秒时准确率和延迟满足率均达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09135 2026-06-09 cs.CR cs.AI 新提交 92%

Steganography Without Modification: Hidden Communication via LLM Seeds

无需修改的隐写术:通过LLM种子进行隐藏通信

Felix Mächtle, Jonas Sander, Sebastian Berndt, Ben Weimar, Nils Loose, Thomas Eisenbarth

机构 * Institute for IT Security, University of Lübeck(吕贝克大学信息安全部) Technische Hochschule Lübeck(吕贝克技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 利用LLM推理栈中确定性解码的伪随机数生成器种子依赖性,提出一种无需修改模型权重或采样代码的隐写信道,通过种子编码秘密消息,接收者通过穷举搜索恢复。

Comments To appear in the Proceedings of the International Conference on Availability, Reliability and Security (ARES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 92%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15626 2026-05-18 cs.LG 92%

IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

IO-SVD:输入-输出白化SVD用于自适应秩LLM压缩

Ali Abbasi, Chayne Thrash, Haoran Qin, Hamed Pirsiavash, Soheil Kolouri

机构 * Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 IO-SVD通过构建KL感知的双侧白化空间,结合高效异质秩分配策略,实现LLM压缩时的性能与效率平衡,实验表明其在压缩过程中性能损失小且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21651 2026-05-18 cs.LG 92%

Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models

重新思考1位后训练量化用于大语言模型的输出对齐

Dung Anh Hoang, Cuong Pham, Cuong Nguyen, Trung le, Jianfei Cai, Thanh-Toan Do

机构 * Department of Data Science and AI(数据科学与人工智能系) Monash University(墨尔本大学) Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心) University of Surrey(萨里大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract_cn)

AI总结 本文提出一种新的1位后训练量化方法,解决输出对齐问题,通过减少层间误差累积和表示空间各向异性畸变,提升大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11169 2026-05-13 cs.AI 92%

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

OLIVIA:通过推理时间动作适应实现LLM ReAct代理的在线学习

Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou, Tong Yu, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 OLIVIA通过在推理时对动作进行适应,改进LLM ReAct代理在部署中的决策能力,提供可跟踪、细粒度和不确定性感知的适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07840 2026-05-11 cs.LG 92%

RelAgent: LLM Agents as Data Scientists for Relational Learning

RelAgent:基于LLM的数据科学家用于关系学习

Xingyue Huang, Louis Tichelman, Jinwoo Kim, Krzysztof Olejniczak, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA(AITHYRA研究所) KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 RelAgent是一种基于LLM的关系学习自主数据科学家,通过两阶段流程构建SQL特征程序并选择预测模型,最终通过SQL查询和经典模型实现快速、确定性和可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07937 2026-04-21 cs.CL 92%

HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy

HCRE: 基于大语言模型的跨文档关系抽取的分层分类方法

Guoqi Ma, Liang Zhang, Hongyao Tu, Hao Fu, Hui Li, Yujie Lin, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Li Auto Inc.(Li Auto公司) Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)

专题命中 效率与部署 :LLM(title,summary_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HCRE方法,通过分层关系树减少LLM需考虑的关系选项,结合预测-验证策略提升可靠性,实验表明其优于现有基线。

Comments ACL 2026 Findings; camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28817 2026-04-01 cs.CR cs.AI 92%

GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models

GUARD-SLM:基于令牌激活的对抗 Jailbreak 攻击防御方法用于小语言模型

Md Jueal Mia, Joaquin Molto, Yanzhao Wu, M. Hadi Amini

机构 * Knight Foundation School of Computing and Information Sciences(奈特基金会计算与信息科学学院) Security, Optimization, and Learning for InterDependent networks laboratory (solid lab)(安全、优化与相互依赖网络学习实验室) Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(title,abstract);large language model(abstract)

AI总结 本文研究了小语言模型在面对异构攻击时的脆弱性,提出GUARD-SLM方法通过分析隐藏层激活来过滤恶意提示,提升小语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09471 2025-08-14 cs.LG 92%

EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models

Omar Bazarbachi, Zijun Sun, Yanning Shen

机构 * Department of Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学系加州大学伊文斯顿分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08554 2025-07-29 cs.LG 92%

ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models

Chao Zeng, Songwei Liu, Yusheng Xie, Hong Liu, Xiaojian Wang, Miao Wei, Shu Yang, Fangmin Chen, Xing Mei

机构 * Project Leader(项目负责人)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18410 2025-02-06 cs.CL 92%

Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting

Bowen Xu, Shaoyu Wu, Kai Liu, Lulu Hu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00492 2024-11-04 cs.CL 92%

Multi-expert Prompting Improves Reliability, Safety, and Usefulness of Large Language Models

Do Xuan Long, Duong Ngoc Yen, Anh Tuan Luu, Kenji Kawaguchi, Min-Yen Kan, Nancy F. Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17066 2024-10-23 cs.AI 92%

VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models

Yifei Liu, Jicheng Wen, Yang Wang, Shengyu Ye, Li Lyna Zhang, Ting Cao, Cheng Li, Mao Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments EMNLP 2024, Main, Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05015 2023-10-12 cs.AI 92%

Compresso: Structured Pruning with Collaborative Prompting Learns Compact Large Language Models

Song Guo, Jiahang Xu, Li Lyna Zhang, Mao Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11627 2023-09-29 cs.CL 92%

LLM-Pruner: On the Structural Pruning of Large Language Models

Xinyin Ma, Gongfan Fang, Xinchao Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17888 2023-05-30 cs.CL 92%

LLM-QAT: Data-Free Quantization Aware Training for Large Language Models

Zechun Liu, Barlas Oguz, Changsheng Zhao, Ernie Chang, Pierre Stock, Yashar Mehdad, Yangyang Shi, Raghuraman Krishnamoorthi, Vikas Chandra

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06723 2026-08-10 cs.LG cs.AI 新提交 92%

Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

基于混合分析-机器学习预测器的大语言模型推理延迟与能耗的多级建模

Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出混合三级框架HYMELL,结合分析建模与机器学习,在NVIDIA H100 GPU上对LLaMA 3 8B的预填充、解码阶段误差均低于5%,可实现LLM推理延迟与能耗的精准估计及能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06470 2026-06-18 cs.CL cs.AI 版本更新 92%

Improve Large Language Model Systems with User Logs

通过用户日志改进大型语言模型系统

Changyue Wang, Weihang Su, Qingyao Ai, Xingzhao Yue, Rui Zhang, Xiaojia Chang, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出UNO框架,通过用户日志提炼规则和偏好对,利用查询反馈驱动聚类处理数据异质性,量化模型知识与日志数据间的认知差距,提升LLM系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09719 2026-06-04 cs.CL cs.AI 92%

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

有界双曲正切:大型语言模型中预层归一化的稳定高效替代方案

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出BHyT,通过有界双曲正切和数据驱动的输入约束替代Pre-LN,在保持稳定性的同时提升训练和推理效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00306 2026-06-02 cs.LG cs.AI 92%

Rethinking the Role of Temperature in Large Language Model Distillation

重新思考温度在大语言模型蒸馏中的作用

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析温度τ对前向KL散度和反向KL散度在LLM蒸馏中的不对称影响,发现高温下FKL优于RKL,并证明温度能提升多种蒸馏目标,使简单KL方法达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26037 2026-05-19 cs.AI cs.CV cs.LG 92%

CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search

CoLLM-NAS:协作大型语言模型用于高效知识引导的神经架构搜索

Zhe Li, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLM-NAS,一种基于协作大型语言模型的两阶段神经架构搜索框架,通过导航和生成两个LLM及协调模块,有效指导搜索过程,提升效率并取得新状态最优结果。

Comments Accepted as Oral at CVPR 2026 Workshop on Neural Architecture Search (NAS)

详情

展开后加载摘要…

URL PDF HTML 收藏