arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 70 篇

2605.15626 2026-05-18 cs.LG 92%

IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

IO-SVD:输入-输出白化SVD用于自适应秩LLM压缩

Ali Abbasi, Chayne Thrash, Haoran Qin, Hamed Pirsiavash, Soheil Kolouri

机构 * Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 IO-SVD通过构建KL感知的双侧白化空间,结合高效异质秩分配策略,实现LLM压缩时的性能与效率平衡,实验表明其在压缩过程中性能损失小且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21651 2026-05-18 cs.LG 92%

Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models

重新思考1位后训练量化用于大语言模型的输出对齐

Dung Anh Hoang, Cuong Pham, Cuong Nguyen, Trung le, Jianfei Cai, Thanh-Toan Do

机构 * Department of Data Science and AI(数据科学与人工智能系) Monash University(墨尔本大学) Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心) University of Surrey(萨里大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract_cn)

AI总结 本文提出一种新的1位后训练量化方法,解决输出对齐问题,通过减少层间误差累积和表示空间各向异性畸变,提升大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19179 2026-05-18 cs.DC 91%

CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing

CascadeInfer: 基于长度意识的LLM服务调度以实现低延迟和负载均衡

Yitao Yuan, Chenqi Zhao, Bohan Zhao, Zane Cao, Yongchao He, Wenfei Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 CascadeInfer通过动态调度请求降低LLM服务延迟和负载不均,提升系统吞吐量,减少端到端延迟达67%。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15601 2026-05-18 cs.DC cs.PF 91%

LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind

LMDeploy通过TurboMind加速混合精度LLM推理

Li Zhang, Youhe Jiang, Guoliang He, Xin Chen, Han Lv, Qian Yao, Ningsheng Ma, Fangcheng Fu, Kai Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 LMDeploy通过TurboMind实现高效混合精度LLM推理,通过通用化和高效的混合精度流水线优化矩阵运算和注意力计算,降低延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08008 2026-05-18 cs.LG 91%

Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts

超越沉没成本:通过专家混合的正交增长提升LLM预训练效率

Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

机构 * ustc(中国科学技术大学) msra(微软亚洲研究院) stju(上海交通大学) xmu(厦门大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出正交增长策略,通过优化专家混合模型的深度和宽度,提升LLM预训练效率,实验证明在相同计算预算下,模型准确率提升10.6%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04457 2026-05-18 cs.CL 90%

RapidUn: Influence-Driven Parameter Reweighting for Efficient Large Language Model Unlearning

RapidUn: 基于影响的参数重加权用于高效的大语言模型反学习

Guoshenghui Zhao, Huawei Lin, Weijie Zhao

机构 * Golisano College of Computing and Information Sciences, Rochester Institute of Technology(罗切斯特理工学院戈利萨诺计算机与信息科学学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 RapidUn通过快速估计模块评估每个样本的影响,将这些分数映射为自适应更新权重,指导选择性参数更新,从而在Mistral-7B和Llama-3-8B上实现比全重训练高100倍的效率,并优于Fisher、GA和LoReUn。

Comments Code available at: https://github.com/eyerf/RapidUn

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 90%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08894 2026-05-18 cs.CL cs.AI 90%

Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

拟合并不足够:在极量化的LLM中平滑性

Yuzhuang Xu, Xu Han, Yuxuan Li, Pengzhan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文指出极量化LLM存在平滑性退化问题,通过平滑性代理发现量化位宽越小退化越严重,提出保持平滑性的方法提升性能,强调平滑性在极端量化中的重要性。

Comments 19 pages, 4 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15962 2026-05-18 cs.CR 89%

PersonaFingerprint: Measuring Persona Inference on Modern Websites with LLM-Driven Browsing

PersonaFingerprint:基于LLM驱动浏览的现代网站人格推断测量

Chuxu Song, Hao Wang, Richard Martin

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文研究了现代网站中通过加密流量元数据推断用户人格的隐私风险,提出了一种基于LLM驱动的多代理浏览框架,并展示了在混合网站流量中人格推断的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04163 2026-05-18 cs.LG 89%

BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models

BPDQ:基于可变网格的位平面分解量化用于大语言模型

Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen Li, Taiqiang Wu, Mengzhao Chen, Zhen Peng, Chaofan Tao, Long Shi, Hongxia Yang, Ngai Wong

机构 * Southwestern University of Finance and Economics(西南财经大学) The University of Hong Kong(香港大学) Artificial Intelligence and Digital Finance Key Laboratory of Sichuan Province(四川省人工智能与数字金融重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出BPDQ,通过位平面和标量系数构建可变量化网格,并利用二阶信息迭代优化,实现2位下大语言模型在单张RTX 3090上达到83.85%的GSM8K准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14087 2026-05-18 cs.CL cs.LG 88%

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

对大语言模型毒性进行测量与缓解:一项全面的复制研究

Mokshit Surana, Archit Rathod, Akshaj Satishkumar

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过复制研究评估DExperts在缓解显性毒性中的有效性,发现其在显性毒性基准上安全性接近完美,但对隐性仇恨言论存在脆性,并引入了10倍的延迟惩罚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17116 2026-05-18 cs.LG cs.CL 88%

Optimizing Large Language Model Training Using FP4 Quantization

使用FP4量化优化大型语言模型训练

Ruizhe Wang, Yeyun Gong, Xiao Liu, Guoshuai Zhao, Ziyue Yang, Baining Guo, Zhengjun Zha, Peng Cheng

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Microsoft SIGMA Team(微软SIGMA团队)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出首个FP4训练框架,通过可微量化估计器和异常值钳制补偿策略,解决量化误差和表示能力限制问题,实现与BF16和FP8相近的精度,适用于大规模语言模型训练。

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:62937-62957, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18167 2026-05-18 cs.CL cs.HC 88%

DiscussLLM: Teaching Large Language Models When to Speak

DiscussLLM:教大语言模型何时说话

Deep Anil Patel, Iain Melvin, Christopher Malon, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美洲实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 DiscussLLM通过两阶段数据生成管道合成大规模多轮人类讨论数据,训练模型主动决定何时发言,提升对话AI的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19701 2026-05-18 cs.LG cs.AI 88%

LASER: Language Model Regression for Semi-Structured Workflow Resource and Runtime Estimation

LASER:用于半结构化工作流资源和运行时间估计的语言模型回归

Yuxuan Yin, Shengke Zhou, Yunjie Zhang, Ajay Mohindra, Boxun Xu, Peng Li

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出LASER框架,通过微调LLM实现多目标资源和运行时间回归,采用科学计数法和约束解码提升预测精度与效率,验证表明其在大规模芯片设计任务和GHARuntime基准上优于人类专家和现有表格型ML方法。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03293 2026-05-18 cs.DC 86%

UMDAM: A Unified Data Layout and DRAM Address Mapping for Heterogenous NPU-PIM

UMDAM: 一种统一的数据布局和DRAM地址映射方案用于异构NPU-PIM

Hai Huang

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 UMDAM通过统一的数据布局和DRAM映射方案,解决NPU-PIM协同计算中的数据布局不匹配、带宽损失和冗余存储问题,提升边缘设备LLM推理效率。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16184 2026-05-18 cs.DC cs.LG 85%

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

面向可扩展大语言模型训练的运行时优化

Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

机构 * Nvidia(英伟达)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Asteria系统,通过分离二次优化逻辑与GPU训练路径,解决大规模矩阵优化器状态维护的系统成本问题,实现在内存受限和分布式训练中提升大语言模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01970 2026-05-18 cs.AI cs.LG 84%

Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models

小规模可泛化提示预测模型可引导大推理模型的高效强化学习后训练

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University, Beijing, China(自动化系,清华大学,北京,中国) LLM Department, Tencent, Beijing, China(大模型部门,腾讯,北京,中国)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPS方法,通过轻量级生成模型进行提示难度的贝叶斯推断,结合中间难度优先和历史锚定多样性,提升大模型强化学习后的训练效率和测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06655 2026-05-18 cs.LG cs.AI 84%

Graph-Regularized Sparse Autoencoders for LLM Safety Steering

图正则化稀疏自编码器用于LLM安全引导

Jehyeok Yeon, Federico Cinus, Yifan Wu, Luca Luceri

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Intesa Sanpaolo(Intesa Sanpaolo公司) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出图正则化稀疏自编码器,通过在神经元共激活图上平滑解码器向量并应用方向库,提升安全引导效果,在多个基准测试中显著提高有害请求拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14236 2026-05-18 cs.LG cs.AI cs.CL 83%

Active Learners as Efficient PRP Rerankers

主动学习者作为高效的PRP重排序器

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero, Santiago Barron, Juan Wisznia, Luciano del Corro

机构 * ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés(ELIAS实验室,工程系,圣安德烈大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);prompting(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将PRP重排序问题重新定义为从噪声成对比较中进行主动学习,证明主动排序器在受限调用下能提升NDCG@10性能,并引入随机方向oracle以降低计算成本。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04816 2026-05-18 cs.HC 83%

Building AI Companions that Prioritise Learning over Performance

构建以学习优先于性能的人工智能伴侣

Hassan Khosravi, Dragan Gasevic, Shazia Sadiq, Lixiang Yan, Jason Lodge, Jason Tangen, Paul Denny, Kristen DiCerbo, Simon Buckingham Shum, Ryan S. Baker

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨如何设计人工智能以支持学习而非仅提升即时输出,提出AI学习伴侣的概念,通过五个案例研究展示其潜力与局限,主张转向以教学为基础、适应性学习和促进深层理解的人工智能设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15417 2026-05-18 cs.LG cs.AI 82%

$f$-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

$f$-轨迹平衡:一种用于调整GFlowNets、生成模型和LLMs的损失家族,结合on-policy和off-policy数据

Jake Fawkes, Jason Hartford

机构 * Department of Statistics, University College London, UK(伦敦大学学院统计学系) Valence Labs, London, UK(伦敦Valence实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于$f$-散度的损失家族,通过on-policy和off-policy数据调整生成模型,提升模型覆盖性和泛化能力。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15206 2026-05-18 cs.LG cs.AI cs.DC 82%

AgentStop: Terminating Local AI Agents Early to Save Energy in Consumer Devices

AgentStop: 早期终止本地AI代理以在消费设备中节省能源

Dzung Pham, Kleomenis Katevas, Ali Shahin Shamsabadi, Hamed Haddadi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brave Software, Imperial College London(Brave软件公司,伦敦帝国学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究提出AgentStop方法,通过预测并提前终止可能失败的代理任务,减少能源消耗,提升本地AI代理的能效与隐私保护。

Comments ACM CAIS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14282 2026-05-18 cs.LG cs.AI 82%

Weight Concentration Regularization for Improving Pruning Robustness Under High Sparsity

权重集中正则化:提高在高稀疏度下的剪枝鲁棒性

Vincent-Daniel Yun, Junhyuk Jo, Sunwoo Lee

机构 * University of Southern California(美国南加州大学) Inha University(inha大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出权重集中正则化(WCR),通过放大少量参数的幅度并驱动其余参数趋近于零,提高模型在高稀疏度下的剪枝鲁棒性,通过在LLM微调、图像分类和医学分割中的实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16141 2026-05-18 eess.SP 82%

SiFo: Wireless Foundation Model for Low-Overhead Site-Specific CSI Feedback

SiFo:面向低开销的特定站点信道状态信息反馈无线基础模型

Cheng-Jie Zhao, Zhaolin Wang, Zongyao Zhao, Yuanwei Liu

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 SiFo提出一种基于无线基础模型的框架,通过预训练和轻量级校准实现高效特定站点CSI反馈,提升频谱效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09034 2026-05-18 cs.LG 81%

Accelerating Zeroth-Order Spectral Optimization with Partial Orthogonalization from Power Iteration

通过幂迭代部分正交化加速零阶谱优化

Jiahe Chen, Ziye Ma

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过幂迭代部分正交化加速零阶优化,改进了Muon中的牛顿-舒尔兹过程,提升了收敛速度和泛化能力,在超大规模语言模型微调中表现出色。

Comments added more related works discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14205 2026-05-18 cs.AI 81%

SimPersona: Learning Discrete Buyer Personas from Raw Clickstreams for Grounded E-Commerce Agents

SimPersona: 从原始点击流中学习离散买家人设以构建 grounded 的电子商务代理

Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang

机构 * Shopify

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 SimPersona 通过学习离散买家类型并将其映射为 LLM 代理的紧凑人设标记,提升电子商务代理的个性化能力,实现 78% 的转化率对齐,并在目标购物任务中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18134 2026-05-18 cs.AI cs.CL cs.CV 81%

VideoGameBench: Can Vision-Language Models complete popular video games?

VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

机构 * Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。

Comments 10 pages, 38 pages including supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15220 2026-05-18 cs.CL cs.AI cs.LG 80%

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

始终学习,始终混合:始终高效且简单的数据混合

Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软公司)

专题命中 效率与部署 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OP-Mix算法,通过低秩适配器插值实现数据混合,提升预训练和持续学习性能,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12266 2026-05-18 q-bio.GN cs.LG 79%

Genome-Factory: A Library for Tuning, Deploying, and Interpreting Genomic Foundation Models

Genome-Factory:用于调优、部署和解释基因组基础模型的库

Weimin Wu, Xuefeng Song, Yibo Wen, Qinjie Lin, Zhihan Zhou, Jerry Yao-Chieh Hu, Zhong Wang, Han Liu

机构 * Center for Foundation Models Generative AI \& Department of Computer Science, Northwestern University, USA School of Natural Sciences, University of California at Merced, USA Department of Energy Joint Genome Institute, Lawrence Berkeley National Laboratory, USA Systems Biology Division, Lawrence Berkeley National Laboratory, USA Department of Statistics Data Science, Northwestern University, USA

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 Genome-Factory 提供了一种统一的流程简化方法,涵盖基因组模型开发的全流程,包括数据收集、模型调优、推理、基准测试和可解释性,适用于多种模型和调优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18556 2026-05-18 cs.CL cs.LG 79%

GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling

GSQ: 通过Gumbel-Softmax采样实现高精度低精度标量量化以用于LLMs

Alireza Dadgarnia, Soroush Tabesh, Mahdi Nikdan, Michael Helcig, Eldar Kurtic, Maximilian Kleinegger, Dan Alistarh

机构 * ISTA ETH Zürich(苏黎世联邦理工学院) Red Hat AI(红帽AI) TU Wien(维也纳技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GSQ,一种基于Gumbel-Softmax松弛的标量量化方法,在低比特数下实现高精度,适用于LLMs的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏