arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2310.03951 2023-10-11 cs.CL cs.AI 88%

Chain of Natural Language Inference for Reducing Large Language Model Ungrounded Hallucinations

Deren Lei, Yaxi Li, Mengya Hu, Mingyu Wang, Vincent Yun, Emily Ching, Eslam Kamal

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments The source code is available at https://github.com/microsoft/CoNLI_hallucination

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09507 2023-10-11 cs.AI cs.CL 88%

Pruning Large Language Models via Accuracy Predictor

Yupeng Ji, Yibo Cao, Jiucai Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 4 figs, submitted to IEEE ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17224 2023-10-02 cs.LG cs.AR cs.CL cs.ET cs.PF 88%

Training and inference of large language models using 8-bit floating point

Sergio P. Perez, Yan Zhang, James Briggs, Charlie Blake, Josh Levy-Kramer, Paul Balanca, Carlo Luschi, Stephen Barlow, Andrew William Fitzgibbon

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06589 2023-09-14 cs.CL cs.AI 88%

Do Generative Large Language Models need billions of parameters?

Sia Gholami, Marwan Omar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04014 2023-09-08 cs.CL cs.LG 88%

Continual Pre-Training of Large Language Models: How to (re)warm your model?

Kshitij Gupta, Benjamin Thérien, Adam Ibrahim, Mats L. Richter, Quentin Anthony, Eugene Belilovsky, Irina Rish, Timothée Lesort

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08621 2023-08-10 cs.CL cs.LG 88%

Retentive Network: A Successor to Transformer for Large Language Models

Yutao Sun, Li Dong, Shaohan Huang, Shuming Ma, Yuqing Xia, Jilong Xue, Jianyong Wang, Furu Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06439 2023-07-14 cs.CL cs.AI 88%

Distilling Large Language Models for Biomedical Knowledge Extraction: A Case Study on Adverse Drug Events

Yu Gu, Sheng Zhang, Naoto Usuyama, Yonas Woldesenbet, Cliff Wong, Praneeth Sanapathi, Mu Wei, Naveen Valluri, Erika Strandberg, Tristan Naumann, Hoifung Poon

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18404 2023-07-11 cs.CL cs.LG stat.ML 88%

Conformal Prediction with Large Language Models for Multi-Choice Question Answering

Bhawesh Kumar, Charlie Lu, Gauri Gupta, Anil Palepu, David Bellamy, Ramesh Raskar, Andrew Beam

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Updated sections on prompt engineering. Expanded sections 4.1 and 4.2 and appendix. Included additional references. Work published at the ICML 2023 (Neural Conversational AI TEACH) workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03027 2023-07-07 cs.LG cs.CL cs.IR 88%

Improving Retrieval-Augmented Large Language Models via Data Importance Learning

Xiaozhong Lyu, Stefan Grafberger, Samantha Biegel, Shaopeng Wei, Meng Cao, Sebastian Schelter, Ce Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04050 2023-06-28 cs.IT cs.CL cs.LG math.IT 88%

LLMZip: Lossless Text Compression using Large Language Models

Chandra Shekhara Kaushik Valmeekam, Krishna Narayanan, Dileep Kalathil, Jean-Francois Chamberland, Srinivas Shakkottai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 7 pages, 4 figures, 4 tables, preprint, added results on using LLMs with arithmetic coding

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04761 2023-06-07 cs.CL cs.LG 88%

NarrowBERT: Accelerating Masked Language Model Pretraining and Inference

Haoxin Li, Phillip Keung, Daniel Cheng, Jungo Kasai, Noah A. Smith

专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

Comments To appear in ACL 2023 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05339 2023-06-01 cs.DC cs.AI cs.LG 88%

Elixir: Train a Large Language Model on a Small GPU Cluster

Haichen Huang, Jiarui Fang, Hongxin Liu, Shenggui Li, Yang You

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13917 2023-05-24 cs.CL cs.AI 88%

Generating Data for Symbolic Language with Large Language Models

Jiacheng Ye, Chengzu Li, Lingpeng Kong, Tao Yu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05524 2023-04-13 cs.LG cs.CL 88%

Understanding Causality with Large Language Models: Feasibility and Opportunities

Cheng Zhang, Stefan Bauer, Paul Bennett, Jiangfeng Gao, Wenbo Gong, Agrin Hilmkil, Joel Jennings, Chao Ma, Tom Minka, Nick Pawlowski, James Vaughan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04381 2023-03-09 cs.LG cs.CL 88%

Automatically Auditing Large Language Models via Discrete Optimization

Erik Jones, Anca Dragan, Aditi Raghunathan, Jacob Steinhardt

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02027 2022-10-07 cs.CL cs.CC cs.IT cs.LG math.IT 88%

Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance

Mario Michael Krell, Matej Kosec, Sergio P. Perez, Andrew Fitzgibbon

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Significantly new version with different authors and much more content. Much larger variety in experiments and exhaustive SOTA analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07852 2022-08-17 cs.CL cs.HC cs.LG 88%

Interactive and Visual Prompt Engineering for Ad-hoc Task Adaptation with Large Language Models

Hendrik Strobelt, Albert Webson, Victor Sanh, Benjamin Hoover, Johanna Beyer, Hanspeter Pfister, Alexander M. Rush

专题命中 效率与部署 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.LG

Comments 9 pages content, 2 pages references

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.04732 2021-03-30 cs.CL cs.LG stat.ML 88%

Structured Pruning of Large Language Models

Ziheng Wang, Jeremy Wohlwend, Tao Lei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19768 2026-07-23 cs.LG cs.AR 新提交 88%

AlphaRoute: Large Language Models as Semantic Optimizers for Multi-Objective Routing

AlphaRoute:将大语言模型用作多目标路由的语义优化器

Kabir Murjani, Mishri Bhavsar, Manish I. Patel, Jonti Talukdar

机构 * Institute of Technology, Nirma University(尼玛大学理工学院) Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)

AI总结 针对VLSI全局路由这一NP难组合优化问题,传统方法失效。AlphaRoute将拆线重布重构为动态优化系统,引入基于SHAP的溢出分解等技术,用大语言模型作语义策略优化器,在基准测试中大幅减少溢出,证明优越算法可克服Python实现的延迟。

Comments 7 pages, 5 figures. Accepted for publication in the IEEE International Conference on LLM-Aided Design, 2026, Stanford University, Stanford, CA, USA. Code available at https://github.com/Kcbir/AlphaRoute

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19350 2026-06-19 cs.CL 新提交 88%

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

基于因果归因的剪枝保留大型语言模型的推理性能

Amogh Sheth, Biruk Assefa, Yi Wen Huang, Andrew Lin, Yuhao Ge

机构 * Edison Academy Magnet School(爱迪生学院磁石学校) Massachusetts Institute of Technology(麻省理工学院) State University of New York College at Plattsburgh(纽约州立大学普拉茨堡学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 提出无需训练的因果归因剪枝(CAP)方法,通过测量注意力头对推理任务的因果影响进行细粒度剪枝,在20%稀疏度下相比Wanda在ARC-Challenge上准确率提升高达61%。

Comments Accepted at the ICLR 2026 Workshop on LLM Reasoning. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08432 2025-07-14 cs.DB cs.CL 88%

xpSHACL: Explainable SHACL Validation using Retrieval-Augmented Generation and Large Language Models

Gustavo Correa Publio, José Emilio Labra Gayo

机构 * University of Leipzig(莱比锡大学) University of Oviedo(奥维耶多大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

Comments Accepted for publication in the 2nd LLM+Graph Workshop, colocated at VLDB'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07304 2024-07-11 cs.AI 88%

Inference Performance Optimization for Large Language Models on CPUs

Pujiang He, Shan Zhou, Wenhuan Huang, Changqing Li, Duyi Wang, Bin Guo, Chen Meng, Sheng Gui, Weifei Yu, Yi Xie

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI;foundation model(comments)

Comments 5 pages, 6 figure, ICML 2024 on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02750 2024-07-04 cs.CL 88%

Learning to Reduce: Towards Improving Performance of Large Language Models on Structured Data

Younghun Lee, Sungchul Kim, Ryan A. Rossi, Tong Yu, Xiang Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;foundation model(comments)

Comments ICML 2024 Workshop on Long-Context Foundation Models, Vienna, Austria 2024. arXiv admin note: substantial text overlap with arXiv:2402.14195

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13499 2026-08-14 cs.DC 新提交 88%

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving

OpScale:面向大语言模型服务的算子级资源配置与自动扩缩容

Xingqi Cui, Chieh-Jan Mike Liang, Ziang Tang, Jiarong Xing, Haoran Qiu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中粗粒度扩缩容的弊端,提出算子级编排框架OpScale,可在满足SLO的同时降低GPU用量、功耗,或在固定成本下提升吞吐量。

Comments 22 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25699 2026-08-05 cs.AR 版本更新 88%

NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference

NVLLM:一种以3D NAND为中心的架构, enabling 边缘设备上的LLM推理

Mingbo Hao, Changwei Yan, Haoyu Cui, Zhihao Yan, Yizhi Ding, Zhangrui Qian, Weiwei Shan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NVLLM通过将前馈网络计算移至Flash并利用轻量CMOS逻辑执行注意力,实现边缘设备上的高效LLM推理,其在参数规模达30B的模型上实现了显著的加速。

Comments Published in the Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026). This version includes additional supplementary material

Journal ref Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 88%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 88%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04595 2026-07-23 cs.AR 版本更新 88%

Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference

Harmonia:面向内存和计算效率的BFP基大语言模型推理算法-硬件协同设计

Xinyu Wang, Jieyu Li, Yanan Sun, Weifeng He

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 Harmonia通过算法-硬件协同设计实现所有层BFP激活,提升LLM推理的内存和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 88%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12446 2026-07-13 cs.CL cs.AI cs.LG 版本更新 88%

Multi-Attribute Steering of Language Models via Targeted Intervention

通过目标干预对语言模型进行多属性引导

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。

Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer

详情

展开后加载摘要…

URL PDF HTML 收藏