arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22089 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22089 篇

2506.07296 2025-06-10 cs.IR cs.AI cs.CV 93%

HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel Retrieval

Arian Askari, Emmanouil Stergiadis, Ilya Gusev, Moran Beladev

机构 * Leiden University(莱顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);small language model(abstract)

Comments Accepted at ACL 2025, Main track. 13 Pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03129 2026-02-02 cs.CV cs.AI cs.CL cs.LG 93%

ARB-LLM: Alternating Refined Binarizations for Large Language Models

ARB-LLM: 交替精炼二值化用于大语言模型

Zhiteng Li, Xianglong Yan, Tianao Zhang, Haotong Qin, Dong Xie, Jiang Tian, zhongchao shi, Linghe Kong, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 ARB-LLM通过交替精炼二值化技术,有效解决LLM二值化中的分布偏移和列偏差问题,实现性能超越现有SOTA方法。

Comments The code and models will be available at https://github.com/ZHITENGLI/ARB-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07388 2026-07-09 cs.CL cs.LG 新提交 93%

TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models

TF-Engram:一种用于大语言模型的基于固态硬盘支持内存的免训练印记

Yutang Ma, Kecheng Huang, Xikun Jiang, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 研究针对大语言模型知识扩展成本高问题,提出TF-Engram免训练印记系统,通过离线构建特定短语语义内存、跨层次存储及预测预取等方法,在Qwen3-0.6B上提升下游分数,证明可将其作为低开销组件集成到LLM推理中。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03465 2026-06-03 cs.LG cs.AI 93%

Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression

重新思考张量分解在训练后大语言模型压缩中的作用

Artur Zagitov, Alexander Miasnikov, Maxim Krutikov, Vladimir Aletov, Gleb Molodtsov, Nail Bashirov, Artem Tsedenov, Aleksandr Beznosikov

机构 * University of Florida(佛罗里达大学) National Research University Higher School of Economics(俄罗斯国家研究大学——莫斯科经济学院)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统评估了张量分解在稠密和MoE架构上的训练后压缩效果,通过实证与理论分析揭示了其与LLM异构表示之间的根本性不匹配,从而界定了其实际限制和在规模化部署中的可行角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03128 2026-06-03 cs.CR cs.AI cs.CL cs.LG 93%

Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation

解耦式智能合约审计:通过蒸馏与聚合的轻量级LLM框架

Bagus Rakadyanto Oktavianto Putra, Muhamad Risqi Utama Saputra, Widyawan, Guntur Dharma Putra

机构 * University of Indonesia(印度尼西亚大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种基于轻量级开源LLM(0.6B-4B参数)的解耦式智能合约审计框架,通过rsLoRA、知识蒸馏和链式验证聚合策略,在漏洞检测中达到98.25%准确率,优于7B-34B参数模型。

Comments 12 pages, 4 figures, 5 tables. Accepted to IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10631 2025-12-11 cs.LG cs.AI cs.CL 93%

LLM-Barber: Block-Aware Rebuilder for Sparsity Mask in One-Shot for Large Language Models

LLM-Barber:用于大语言模型单次剪枝的块感知重排器

Yupeng Su, Ziyi Guan, Xiaoqun Liu, Tianlai Jin, Dongkuan Wu, Zhengfei Chen, Graziano Chesi, Ngai Wong, Hao Yu

机构 * School of Microelectronics, Southern University of Science and Technology(微电子学院,南方科技大学) Department of Electrical and Electronic Engineering, University of Hong Kong(电气与电子工程系,香港大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 LLM-Barber 是一种新型单次剪枝框架,通过块感知误差优化提升大语言模型剪枝效率,实现高性能与低计算复杂性。

Comments Accepted by ICCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10926 2025-06-30 cs.LG cs.AI cs.CL 93%

Federated Data-Efficient Instruction Tuning for Large Language Models

Zhen Qin, Zhaomin Wu, Bingsheng He, Shuiguang Deng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17849 2024-06-06 cs.LG cs.AI cs.CL 93%

I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models

Xing Hu, Yuan Cheng, Dawei Yang, Zhihang Yuan, Jiangyong Yu, Chen Xu, Sifan Zhou

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10438 2024-04-03 cs.CL cs.AI cs.LG 93%

SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

Guangxuan Xiao, Ji Lin, Mickael Seznec, Hao Wu, Julien Demouth, Song Han

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments ICML 2023. First two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05276 2025-04-03 cs.AI cs.LG 93%

Making Large Language Models Better Knowledge Miners for Online Marketing with Progressive Prompting Augmentation

Chunjing Gan, Dan Yang, Binbin Hu, Ziqi Liu, Yue Shen, Zhiqiang Zhang, Jinjie Gu, Jun Zhou, Guannan Zhang

专题命中 效率与部署 :prompting(title,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by ICDE 2025, new version paper title: Effectively PAIRing LLMs with Online Marketing via Progressive Prompting Augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07378 2025-03-18 cs.CL cs.LG 93%

SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression

Xin Wang, Yu Zheng, Zhongwei Wan, Mi Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

Comments ICLR 2025; Code available at: AIoT-MLSys-Lab/SVD-LLM" target="_blank" rel="noopener">https://github.com/AIoT-MLSys-Lab/SVD-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 92%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10104 2026-06-16 cs.CR cs.AI cs.IR 交叉投稿 92%

Phishing Email Detection Using Large Language Models

使用大型语言模型检测钓鱼邮件

Najmul Hasan, Prashanth BusiReddyGari, Haitao Zhao, Yihao Ren, Jinsheng Xu, Shaohu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出LLMPEA框架,利用GPT-4o等三种前沿LLM检测钓鱼邮件,准确率超90%,并揭示对抗攻击、提示注入和多语言攻击的漏洞。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交 92%

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI 92%

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17827 2026-04-21 cs.CL 92%

Learning to Seek Help: Dynamic Collaboration Between Small and Large Language Models

学习寻求帮助:小语言模型与大语言模型之间的动态协作

Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Jiarui Zhang, Shaojie Tang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) WeChat Tencent, Beijing, China(微信腾讯) State University of New York at Buffalo, New York, United States(纽约州立大学布法罗分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文提出动态协作框架,使小模型主动请求大模型进行多步推理,大模型提供适应性反馈,通过系统研究协作策略受模型能力与效率隐私约束的影响,实验表明动态策略优于静态流程和独立推理,并能稳健迁移至未见的大模型。

Comments 8 content pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23136 2026-06-23 cs.NI cs.AI cs.LG 新提交 92%

LLM-Aided A* Search in Non-Geometric Network Graphs

LLM辅助的非几何网络图中的A*搜索

Nouf Alabbasi, Esraa Ghourab, Omar Alhussein

机构 * KU 6G Research Centre, Department of Computer Science, Khalifa University, Abu Dhabi, UAE(KU 6G研究中心,计算机科学系,哈利法大学,阿布扎赫德,阿联酋)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对非几何网络图最短路径问题,提出LLM辅助A*算法,利用LLM生成中间路标点引导搜索,结合路标距离作为启发式,减少约50%扩展节点,路径成本略有增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08696 2026-06-09 cs.LG cs.AI 新提交 92%

Agentic Search for Counterfactual Recourse under Fixed LLM Budgets

固定LLM预算下的反事实追索的智能搜索

Yasuo Tabei

机构 * RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Comp-MCTS框架,在固定LLM调用预算下,通过树搜索最大化生成唯一且经oracle验证的反事实,平衡数量与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21459 2026-06-04 cs.CR cs.CL cs.LG 92%

SBASH: a Framework for Designing and Evaluating RAG vs. Prompt-Tuned LLM Honeypots

SBASH:用于设计和评估RAG与提示调优的LLM蜜罐框架

Adetayo Adebimpe, Helmut Neukirchen, Thomas Welsh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 提出SBASH框架,利用轻量级本地LLM和RAG技术构建蜜罐,通过多种指标评估RAG与提示调优对LLM蜜罐真实性和响应延迟的影响。

Comments to be published in: The 3rd International Conference on Foundation and Large Language Models (FLLM2025), IEEE, 2025

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16400 2026-05-19 cs.DC cs.AI cs.LG 92%

CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters

CoLLM:面向共享GPU集群的SLO感知LLM服务连续适应

Shaoyuan Huang, Yunfeng Zhao, Na Yan, Tiancheng Zhang, Xiaokai Wang, Xiaofei Wang, Wenyu Wang, Yansha Deng

机构 * Tianjin University(天津大学) King's College London(伦敦大学国王学院) Paiou Cloud Computing (Shanghai) Company, Ltd.(上海帕优云计算有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoLLM通过统一联邦参数高效微调与推理,实现LLM服务在共享GPU集群中的连续适应,提升模型质量和效率,实验显示其在吞吐量上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14443 2026-05-15 cs.AI cs.LG cs.MA 92%

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

多步推理和工具使用中黑盒LLM的提示策略:基于经验迭代蒸馏的强化学习框架

Krishna Sayana, Ketan Todi, Ambarish Jash

机构 * Google Research(谷歌研究)

专题命中 效率与部署 :LLM(title_cn,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于经验迭代蒸馏的强化学习框架,用于训练提示策略以提升黑盒LLM的多步推理和工具使用能力,实验显示在逻辑推理和工具使用任务中性能显著提升。

Comments 10 pages and reference, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20898 2026-05-12 eess.AS cs.CL cs.LG 92%

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

通过可学习投影减少基于LLM的语音识别中的提示敏感性

Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(苏黎世联邦理工学院) Uniphore(Uniphore公司) University of Zurich(苏黎世大学) Brno University of Technology(布拉格技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种可学习的提示投影模块,通过优化LLM输入空间提升语音识别性能,减少提示设计的不稳定性。

Comments Paper accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01493 2026-04-24 cs.LG cs.AI 92%

OpInf-LLM: Parametric PDE Solving with LLMs via Operator Inference

OpInf-LLM:通过算子推断实现基于LLM的参数PDE求解

Zhuoyuan Wang, Hanjiang Hu, Xiyu Deng, Saviz Mowlavi, Yorie Nakahira

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出OpInf-LLM框架,利用少量解数据实现多样PDE实例的准确预测,支持自然语言任务指定和物理基础推理,降低计算需求并提高异构环境下的求解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07375 2026-02-10 cs.CL cs.LG 92%

Efficient Post-Training Pruning of Large Language Models with Statistical Correction

大型语言模型高效后训练剪枝与统计修正

Peiqi Yu, Jinhao Wang, Xinyi Sui, Nam Ling, Wei Wang, Wei Jiang

机构 * Department of Computer Science and Engineering, Santa Clara University, Santa Clara, CA, USA(计算机科学与工程系,圣克拉拉大学) Futurewei Technologies, Inc., USA(未来韦艾技术公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出了一种基于模型权重和激活统计性质的轻量级后训练剪枝方法,通过统计修正提升剪枝性能,同时保持计算效率。

Comments 11 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01937 2026-02-03 cs.LG cs.AI 92%

T-LLM: Teaching Large Language Models to Forecast Time Series via Temporal Distillation

T-LLM:通过时间蒸馏教大语言模型进行时间序列预测

Suhan Guo, Bingxu Wang, Shaodan Zhang, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 T-LLM通过时间蒸馏框架,使通用大语言模型具备时间序列预测能力,实验显示其在多种设置下均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16989 2026-01-05 cs.LG cs.AI 92%

PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models

PTQTP: 预训练量化到三平面用于大语言模型

He Xiao, Runming Yang, Qingyao Yang, Wendong Xu, Zhen Li, Yupeng Su, Zhengwu Liu, Hongxia Yang, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 PTQTP通过分解权重矩阵为三平面实现高效大语言模型量化,提升推理速度并减少资源消耗。

Comments Ternary Quantization, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03332 2025-12-30 cs.LG cs.AI 92%

Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models

探索分层信息有效性以实现小语言模型的后训练量化

He Xiao, Qingyao Yang, Dirui Xie, Wendong Xu, Zunhai Su, Runming yang, Wenyong Zhou, Haobo Liu, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);large language model(abstract)

AI总结 LieQ通过分层信息有效性量化方法,在亚8B模型中实现高效低比特压缩,减少精度损失并提升边缘设备部署可行性。

Comments low-bit quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14871 2025-10-14 cs.CL cs.LG 92%

Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Models

Ryan Solgi, Kai Zhen, Rupak Vignesh Swaminathan, Nathan Susanj, Athanasios Mouchtaris, Siegfried Kunzmann, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣巴巴拉分校) Amazon(亚马逊)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);pretraining(abstract)

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15828 2025-08-25 cs.LG cs.CL 92%

Z-Pruner: Post-Training Pruning of Large Language Models for Efficiency without Retraining

Samiul Basir Bhuiyan, Md. Sazzad Hossain Adib, Mohammed Aman Bhuiyan, Muhammad Rafsan Kabir, Moshiur Farazi, Shafin Rahman, Nabeel Mohammed

机构 * Department of Electrical and Computer Engineering, North South University, Dhaka, 1229, Bangladesh(电气与计算机工程系,北南大学,达卡,孟加拉国) Data Science and AI, University of Doha for Science and Technology, Doha, Qatar(数据科学与人工智能,多哈科学技术大学,多哈,卡塔尔)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments Accepted at AICCSA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14917 2025-05-27 cs.LG cs.CL 92%

SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models

Wei Huang, Haotong Qin, Yangdong Liu, Yawei Li, Qinshuo Liu, Xianglong Liu, Luca Benini, Michele Magno, Shiming Zhang, Xiaojuan Qi

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏