arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2503.05005 2025-03-12 cs.CL cs.AI cs.LG 88%

Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Models

Benyamin Jamialahmadi, Parsa Kavehzadeh, Mehdi Rezagholizadeh, Parsa Farinneya, Hossein Rajabzadeh, Aref Jafari, Boxing Chen, Marzieh S. Tahaei

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16937 2025-03-03 cs.LG cs.AI cs.CL 88%

TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models

Makoto Shing, Kou Misaki, Han Bao, Sho Yokoi, Takuya Akiba

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);foundation model(abstract);instruction tuning(abstract)

Comments To appear at the 13th International Conference on Learning Representations (ICLR 2025) as a Spotlight presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16406 2025-02-21 cs.LG cs.AI cs.CL cs.CV 88%

SpinQuant: LLM quantization with learned rotations

Zechun Liu, Changsheng Zhao, Igor Fedorov, Bilge Soran, Dhruv Choudhary, Raghuraman Krishnamoorthi, Vikas Chandra, Yuandong Tian, Tijmen Blankevoort

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04428 2025-02-10 cs.CL cs.AI cs.LG 88%

Confident or Seek Stronger: Exploring Uncertainty-Based On-device LLM Routing From Benchmarking to Generalization

Yu-Neng Chuang, Leisheng Yu, Guanchu Wang, Lizhe Zhang, Zirui Liu, Xuanting Cai, Yang Sui, Vladimir Braverman, Xia Hu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14371 2025-01-27 cs.CL cs.AI cs.LG 88%

DRESSing Up LLM: Efficient Stylized Question-Answering via Style Subspace Editing

Xinyu Ma, Yifeng Xu, Yang Lin, Tianlong Wang, Xu Chu, Xin Gao, Junfeng Zhao, Yasha Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments ICLR 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16117 2024-12-23 cs.CV 88%

PruneVid: Visual Token Pruning for Efficient Video Large Language Models

Xiaohu Huang, Hao Zhou, Kai Han

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

Comments Efficient Video Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13082 2024-11-21 cs.CL cs.AI cs.LG 88%

Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning

Xuechen Zhang, Zijian Huang, Ege Onur Taga, Carlee Joe-Wong, Samet Oymak, Jiasi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06910 2024-07-22 cs.CL cs.AI cs.LG 88%

Superposition Prompting: Improving and Accelerating Retrieval-Augmented Generation

Thomas Merth, Qichen Fu, Mohammad Rastegari, Mahyar Najibi

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12009 2024-06-27 cs.CL cs.AI cs.LG 88%

Active Preference Inference using Language Models and Probabilistic Reasoning

Wasu Top Piriyakulkij, Volodymyr Kuleshov, Kevin Ellis

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04291 2024-06-19 cs.LG cs.AI cs.CL 88%

BiLLM: Pushing the Limit of Post-Training Quantization for LLMs

Wei Huang, Yangdong Liu, Haotong Qin, Ying Li, Shiming Zhang, Xianglong Liu, Michele Magno, Xiaojuan Qi

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02582 2023-08-10 cs.CL cs.AI cs.LG 88%

Adapt and Decompose: Efficient Generalization of Text-to-SQL via Domain Adapted Least-To-Most Prompting

Aseem Arora, Shabbirhussain Bhaisaheb, Harshit Nigam, Manasi Patwardhan, Lovekesh Vig, Gautam Shroff

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 88%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16809 2024-03-26 eess.SY cs.AI cs.LG cs.SY 88%

An LLM-Based Digital Twin for Optimizing Human-in-the Loop Systems

Hanqing Yang, Marie Siew, Carlee Joe-Wong

专题命中 效率与部署 :LLM(title,abstract);foundation model(abstract,comments);large language model(abstract);language model(abstract)

Comments Accepted at International Workshop on Foundation Models for Cyber-Physical Systems & Internet of Things (FMSys) 2024, Co-located at CPS-IoT Week 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 88%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22170 2026-08-19 math.NA cs.LG cs.NA stat.ML 版本更新 88%

Large Language Models: A Mathematical Formulation

大语言模型:数学表述

Ricardo Baptista, Andrew Stuart, Son Tran

机构 * Statistical Sciences, University of Toronto(多伦多大学统计科学系) Vector Institute(向量研究所) Amazon Search(亚马逊搜索) Computing and Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种大语言模型的数学框架,涵盖文本编码、模型架构、学习过程及部署方法,旨在提升算法的准确性、效率和鲁棒性。

Comments 56 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16336 2026-08-18 cs.AR cs.DC cs.LG 新提交 88%

Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

超越二元优先级:面向大语言模型服务的多层级SLA调度

Anders Vestrum, Arya Raeesi, Hanna Roed

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究扩展Llumnix的优先级模型支持任意层级,在Vidur模拟器中对比多基线,发现四层优先级调度成本效益最优,10层时仍能维持收益且无尾部延迟崩溃。

Comments 13 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 88%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01637 2026-08-13 cs.LG 88%

Chance-Constrained Inference for Hallucination Risk Control in Large Language Models

针对大语言模型幻觉风险的置信约束推断

Sreenivasan Mohandas

机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,海得拉巴,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究提出置信约束推断方法,通过限制幻觉发生的概率,实现大语言模型在部署时的风险控制,实验显示其在风险控制、输入检测和重复使用中的有效性。

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02404 2026-08-11 cs.LG 版本更新 88%

Statistically-Lossless Quantization of Large Language Models

大语言模型的统计无损量化

Michael Helcig, Eldar Kurtic, Dan Alistarh

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出统计无损压缩的中间路径,定义任务无损与分布无损的量化标准,证明对称与非对称量化的方差差异,通过SLQ方法实现大语言模型的任务无损、分布无损压缩及1.7-3.7倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 88%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29082 2026-08-03 cs.CL 新提交 88%

Can Zero-Shot LLMs Predict Child Malnutrition? A Fairness and Temporal Robustness Study

零样本大型语言模型能否预测儿童营养不良?一项关于公平性与时序鲁棒性的研究

Muhammad Ashad Kabir, Md Ahshanul Haque

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯斯特大学计算、数学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究评估零样本LLM预测儿童营养不良的可行性,发现GPT-4o-mini零样本预测儿童发育迟缓性能接近随机森林基线,灵敏度更高、性别公平性好、时序稳定,但居住地和家庭财富维度存在公平性差异,需进一步研究。

Comments Accepted to AIME 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24801 2026-07-29 cs.IR cs.CL 新提交 88%

Influence of Prompt Engineering on Small Language Models for Guarded Query Routing

提示工程对用于安全查询路由的小型语言模型的影响

Richard Šléher, William Brach, Kristián Košťál, Lukas Galke Poech

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 研究安全查询路由问题,探究紧凑型开放权重小型语言模型在延迟约束下处理任务的能力。通过实验评估发现中等规模模型在低延迟下接近前沿,提示优化技术可提升模型表现,是安全查询路由的有用第一步,部分弱模型仍需其他调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25647 2026-07-29 cs.SE cs.AI cs.MA quant-ph 新提交 88%

KQFuzz: Knowledge-Guided Fuzzing for Quantum Libraries via Large Language Models

KQFuzz:通过大语言模型对量子库进行知识引导的模糊测试

Fuyuan Xia, Qixin Zhang, Chenhao Ying, Haojin Zhu, Shuai Wang, Yuan Luo, Pingchuan Ma, Yuxuan Du

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 针对量子库模糊测试灵活性和效率不足问题,提出KQFuzz,利用代码库知识结合适应度引导评估与两级变异,实现高质量测试生成。在三个量子库上测试效果显著优于其他方法,发现多个错误,推动量子计算领域发展。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering. 17 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23445 2026-07-28 cs.CV cs.CL 新提交 88%

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝

Yiming Zhong, Chang Nie, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。

Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22587 2026-07-28 cs.AI 新提交 88%

TriSP: Tri-Signal Structured Pruning for Large Language Models

TriSP:用于大语言模型的三信号结构化剪枝

Manel Kara laoua, Soumia Bouyahiaoui, Aicha Boutorh

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型部署受参数成本限制问题,提出TriSP方法,结合权重幅度、激活范数与梯度敏感性产生通道级分数,联合自适应预算分配和低秩适应恢复,实现低困惑度、高零样本准确率及高推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22568 2026-07-28 cs.AI cs.NI 新提交 88%

Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting

关键词很重要:揭示设备端大语言模型提示的能量敏感性

Ruiyi Tao, Xiaolong Tu, Haoxin Wang

机构 * Georgia State University(佐治亚州立大学)

专题命中 效率与部署 :LLM(title);prompting(title);large language model(abstract);language model(abstract)

AI总结 研究设备端大语言模型提示措辞与能耗关系,通过在智能手机上收集功率测量数据,量化语言特征对解码长度和总能量的影响,发现提示工程是提高能效的有效手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06127 2026-07-28 cs.LG 版本更新 88%

Compressing LLMs with MoP: Mixture of Pruners

用MoP压缩LLM:剪枝混合方法

Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MoP通过结合深度和宽度剪枝,提升了LLM的压缩效率和推理速度,同时在视觉-语言模型中实现了更高的计算效率。

Comments Code and models are available at: https://github.com/c2d-usp/Efficient-LLMs-with-MoP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16339 2026-07-23 cs.AI 版本更新 88%

LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models

LaCache:用于扩散大语言模型的精确缓存和精度自适应推理

Xingru Chen, Zelang Liang, Yongjia Ma, Jiqing Zhan, Shuling Yang, Lian Wen, Kun Zhan

机构 * Li Auto Inc.(理想汽车公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对扩散大语言模型算子级冗余问题,提出LaCache加速框架,通过无损缓存中间结果及集成FP8量化策略,无需训练,单独使用可实现约1.3倍端到端加速,与现有方法结合可达40.2倍加速且保持任务精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11834 2026-07-15 cs.CV cs.AI cs.RO cs.SY eess.IV eess.SY 88%

Recent Advances in Transformer and Large Language Models for UAV Applications

Transformer及大语言模型在无人机应用中的最新进展

Hamza Kheddar, Yassine Habchi, Mohamed Chahine Ghanem, Mustapha Hemis, Dusit Niyato

机构 * LSEA Laboratory, Department of Electrical Engineering, University of Medea, 26000, Algeria(里塞阿实验室,电气工程系,梅迪亚大学,阿尔及利亚) Institute of Technology, University Centre Salhi Ahmed, Naama, Algeria(技术研究所,萨利哈·阿赫迈德大学中心,纳马,阿尔及利亚) Cybersecurity Institute, Department of Computer Science, University of Liverpool, L69 3BX, Liverpool, UK(网络安全研究所,计算机科学系,利物浦大学,英国) LCPTS Laboratory, University of Sciences(LCPTS实验室,科学大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore.(数据科学,南洋理工大学,新加坡)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了Transformer及大语言模型在无人机应用中的最新进展,包括分类、混合模型、强化学习和大语言模型的应用,以及精准农业和自主导航等新兴应用。

Journal ref ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11012 2026-07-14 cs.CL 新提交 88%

EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架

Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Gengsheng Li, Zhepei Hong, Chang Wu, Pengfei Liu, Junfeng Fang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏