arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2505.05619 2026-03-04 cs.CR cs.LG 90%

LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities

LiteLMGuard: 无缝且轻量级的设备端提示过滤,用于保护小型语言模型免受量化引发的风险和漏洞

Kalyan Nakka, Jimmy Dani, Ausmit Mondal, Nitesh Saxena

机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 LiteLMGuard通过设备端实时提示过滤,有效保护小型语言模型免受量化带来的安全风险。

Comments 18 pages, 19 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00846 2026-03-03 cs.IR cs.LG 90%

Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models

Tiny-Critic RAG:赋能代理回退的参数高效小型语言模型

Yichao Wu, Penghao Liang, Yafei Xiang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan

机构 * Northeastern University(东北大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 Tiny-Critic RAG通过参数高效的Small Language Model实现低延迟的二进制路由,有效降低代理部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18420 2026-02-23 cs.CL 90%

SPQ: An Ensemble Technique for Large Language Model Compression

SPQ:一种用于大语言模型压缩的集成技术

Jiamin Yao, Eren Gultepe

机构 * Dept. of Computer Science, Southern Illinois University Edwardsville(计算机科学系,南方伊利诺伊大学爱德华兹维尔分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 SPQ通过结合SVD、剪枝和量化技术,实现大语言模型的有效压缩,提升推理效率并保持模型性能。

Comments Accepted to LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17829 2026-02-23 cs.LG 90%

Causality by Abstraction: Symbolic Rule Learning in Multivariate Timeseries with Large Language Models

通过抽象实现因果关系:利用大语言模型在多变量时间序列中进行符号规则学习

Preetom Biswas, Giulia Pedrielli, K. Selçuk Candan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ruleXplain利用大语言模型提取多变量时间序列中的因果规则,通过生成反事实输入轨迹和闭环细化确保规则的可验证性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11495 2026-02-23 cs.CR cs.CL 90%

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14302 2026-02-17 cs.DC cs.LG 90%

Floe: Federated Specialization for Real-Time LLM-SLM Inference

Floe:面向实时LLM-SLM推理的联邦专业化

Chunlin Tian, Kahou Tam, Yebo Wu, Shuaihang Zhong, Li Li, Nicholas D. Lane, Chengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);SLM(title);large language model(abstract);language model(abstract)

AI总结 Floe通过结合云LLM和边缘SLM实现低延迟隐私保护推理,提升实时环境下的个性化与性能

Comments Accepted by IEEE Transactions on Parallel and Distributed Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13890 2026-02-17 cs.CL 90%

Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach

评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法

Amir Hossein Mohammadi, Ali Moeinian, Zahra Razavizade, Afsaneh Fatemi, Reza Ramezani

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。

Comments 32 Pages, Submitted to Journal of Computing and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05846 2026-02-10 cs.CL 90%

Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer

Luth:小语言模型和跨语言迁移的高效法语专业化

Maxence Lasbordes, Sinoué Gad

机构 * LightOn, Paris Inria Paris(LightOn 巴黎 国家信息与自动化所巴黎)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 Luth通过定向后训练提升法语小语言模型性能,同时保留英语能力,并通过模型合并增强跨语言迁移效果。

Comments Accepted at the EACL 2026 Student Research Workshop (SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01410 2026-02-03 cs.LG cs.AR 90%

SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training

SNIP:一种用于子字节大语言模型训练的自适应混合精度框架

Yunjie Pan, Yongyi Yang, Hanmei Yang, Scott Mahlke

机构 * University of Michigan(密歇根大学) NTT Research, Inc.(NTT研究公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 SNIP通过自适应混合精度框架,有效提升大语言模型训练效率,减少FLOPs达80%并保持模型质量。

Comments Accepted to ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01222 2026-02-03 cs.AI 90%

FutureMind: Equipping Small Language Models with Strategic Thinking-Pattern Priors via Adaptive Knowledge Distillation

FutureMind: 通过自适应知识蒸馏为小型语言模型配备战略思维模式先验

Shaoxiong Yang, Junting Li, Mengyuan Zhang, Chao Li, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 FutureMind通过自适应知识蒸馏为小型语言模型配备战略思维模式先验,提升其在复杂任务中的推理与检索能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00694 2026-01-05 cs.AI 90%

A Vision-and-Knowledge Enhanced Large Language Model for Generalizable Pedestrian Crossing Behavior Inference

一种融合视觉与知识的大型语言模型用于可推广的行人过街行为推断

Qingwen Pu, Kun Xie, Hong Yang, Guocong Zhai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本研究提出PedX-LLM,融合视觉与知识的大型语言模型,用于可推广的行人过街行为推断,通过整合视觉特征和领域知识提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11518 2026-01-05 cs.CL 90%

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

W2S-AlignTree: 通过蒙特卡洛树搜索实现大语言模型的弱到强推理时对齐

Zhenyu Ding, Yuhao Wang, Tengyue Xiao, Haoying Wang, Caigui Jiang, Ning Ding

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 W2S-AlignTree通过结合MCTS与弱到强泛化范式,实现大语言模型在推理时的高效对齐,提升摘要任务性能15.9%。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22334 2025-12-10 cs.PF cs.AI 90%

Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends

边缘部署的小语言模型:CPU、GPU和NPU后端的综合比较

Pablo Prieto, Pablo Abad

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本研究比较了CPU、GPU和NPU在边缘部署小语言模型的性能和能效,发现NPU在性能和能效上表现最佳。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00040 2025-12-02 cs.NI cs.AI 90%

Constrained Network Slice Assignment via Large Language Models

通过大语言模型实现受约束的网络切片分配

Sagar Sudhakara, Pankaj Rajak

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大语言模型实现网络切片分配,通过零样本提示生成初始分配方案,并结合优化求解器提升性能,实现高效的5G网络资源分配。

Comments Accepted at NeurIPS 2025 Workshop on AI and ML for Next-Generation Wireless Communications and Networking (AI4NextG), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22955 2025-12-01 cs.LG 90%

Experts are all you need: A Composable Framework for Large Language Model Inference

专家足矣:一种用于大语言模型推理的可组合框架

Shrihari Sridharan, Sourjya Roy, Anand Raghunathan, Kaushik Roy

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 Comp-LLM通过可组合的推理框架实现跨专家协作,提升大语言模型的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 90%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SFT(abstract);preference optimization(abstract)

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15434 2025-11-20 cs.CR cs.AI 90%

Small Language Models for Phishing Website Detection: Cost, Performance, and Privacy Trade-Offs

小型语言模型在钓鱼网站检测中的应用:成本、性能与隐私的权衡

Georg Goldenits, Philip Koenig, Sebastian Raubitzek, Andreas Ekelhart

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文研究了小型语言模型在钓鱼网站检测中的应用,探讨了其在成本、性能和隐私方面的权衡,展示了SLMs在替代外部LLM服务方面的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19134 2025-11-20 cs.CR cs.CL 90%

Confidential Prompting: Privacy-preserving LLM Inference on Cloud

Caihua Li, In Gim, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 效率与部署 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13476 2025-11-18 cs.AI 90%

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation

Zhipeng Ma, Ali Rida Bahja, Andreas Burgdorf, André Pomp, Tobias Meisen, Bo Nørregaard Jørgensen, Zheng Grace Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref Applied Sciences, 2025, 15(21), 11619

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03830 2025-11-07 cs.CL 90%

Divide, Cache, Conquer: Dichotomic Prompting for Efficient Multi-Label LLM-Based Classification

Mikołaj Langner, Jan Eliasz, Ewa Rudnicka, Jan Kocoń

机构 * Department of Artificial Intelligence, Wroclaw Tech, Poland(人工智能系,沃拉布勒技术学院,波兰)

专题命中 效率与部署 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04405 2025-11-04 cs.LG 90%

FlexQ: Efficient Post-training INT6 Quantization for LLM Serving via Algorithm-System Co-Design

Hao Zhang, Aining Jia, Weifeng Bu, Yushu Cai, Kai Sheng, Hao Chen, Xin He

专题命中 效率与部署 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25817 2025-10-31 cs.CL 90%

A Survey on Efficient Large Language Model Training: From Data-centric Perspectives

Junyu Luo, Bohan Wu, Xiao Luo, Zhiping Xiao, Yiqiao Jin, Rong-Cheng Tu, Nan Yin, Yifan Wang, Jingyang Yuan, Wei Ju, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Georgia Institute of Technology(佐治亚理工学院) Nanyang Technological University(南洋理工大学) HKUST(香港科技大学) University of International Business and Economics(国际商务经济大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22101 2025-10-28 cs.IR cs.LG 90%

Scaling Up Efficient Small Language Models Serving and Deployment for Semantic Job Search

Kayhan Behdin, Qingquan Song, Sriram Vasudevan, Jian Sheng, Xiaojing Ma, Z Zhou, Chuanrui Zhu, Guoyao Li, Chanh Nguyen, Sayan Ghosh, Hejian Sang, Ata Fatahi Baarzi, Sundara Raman Ramachandran, Xiaoqing Wang, Qing Lan, Vinay Y S, Qi Guo, Caleb Johnson, Zhipeng Wang, Fedor Borisyuk

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05943 2025-10-08 cs.DC cs.LG 90%

EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models

Zheyue Tan, Mustapha Abdullahi, Tuo Shi, Huining Yuan, Zelai Xu, Chao Yu, Boxun Li, Bo Zhao

机构 * Aalto University(阿alto大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25622 2025-10-07 cs.LG 90%

Layer-wise dynamic rank for compressing large language models

Zhendong Mi, Bian Sun, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Carnegie Mellon University(卡内基梅隆大学) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03353 2025-08-11 cs.CL 90%

Towards Pareto Optimal Throughput in Small Language Model Serving

Pol G. Recasens, Yue Zhu, Chen Wang, Eun Kyung Lee, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) IBM Research(IBM研究院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments Revised version of the paper published at EuroMLSys'24, fix figure 6 and 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02668 2025-08-05 cs.LG 90%

LOST: Low-rank and Sparse Pre-training for Large Language Models

Jiaxi Li, Lu Yin, Li Shen, Jinjin Xu, Liwu Xu, Tianjin Huang, Wenwu Wang, Shiwei Liu, Xilu Wang

机构 * University of Surrey(塞维利亚大学) University of Oxford(牛津大学) Sun Yat-sen University(中山大学) Bytedance(字节跳动) Alibaba Group(阿里巴巴集团) University of Exeter(埃克塞特大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09329 2025-06-12 cs.CL 90%

Towards Efficient and Effective Alignment of Large Language Models

Yuxin Jiang

机构 * Division of Emerging Interdisciplinary Areas(新兴跨学科领域 division)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14055 2025-05-28 cs.CL 90%

DRPruning: Efficient Large Language Model Pruning through Distributionally Robust Optimization

Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Jing Li, Min Zhang, Zhaopeng Tu

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究院,哈尔滨工业大学深圳校区)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10735 2025-05-26 cs.CL 90%

Beyond One-Size-Fits-All Pruning via Evolutionary Metric Search for Large Language Models

Shuqi Liu, Bowei He, Han Wu, Linqi Song

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏