Foundations of Large Language Model Compression -- Part 1: Weight Quantization
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments Preprint. 17 pages, 4 figures, 5 appendices
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments Preprint. 17 pages, 4 figures, 5 appendices
专题命中 效率与部署 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments Accepted by ACMMM2024
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments ICLR 2024 Camera Ready
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments Code is available at https://github.com/jfisher52/JAMDecoding
专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)
Comments Accepted at EACL 2024
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);prompting(abstract)
Comments Accepted at EMNLP 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments Accepted to EMNLP 2023 (Long paper)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments Findings of EMNLP 2023
评估小型语言模型用于前端路由:一个统一的基准和合成流量实验
机构 * Plexor Labs(Plexor实验室) ; Project Autobots
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,comments);LLM(abstract)
AI总结 本文通过统一基准和合成流量实验,评估小型语言模型在前端路由中的性能,发现Qwen-2.5-3B在准确率、延迟和成本上表现优异,但整体仍存在准确率与延迟的平衡问题。
Comments 23 pages, 1 figure, 9 tables. Article 8 in the TAAC Research Series. Code and data: https://github.com/micoverde/plexor-slm-frontdoor-rct
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);pretraining(abstract)
Comments GitHub repo: https://github.com/tiingweii-shii/Awesome-Resource-Efficient-LLM-Papers
HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形
机构 * Hong Kong Baptist University(香港浸会大学) ; Guangdong Polytechnic Normal University(广东技术师范大学) ; Guangdong Institute of Digital Industry(广东数字产业研究院) ; The Hong Kong Polytechnic University(香港理工大学) ; The Education University of Hong Kong(香港教育大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。
Comments Preprint, August 2026. 10 tables, 2 figures
面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法
机构 * Tsinghua University(清华大学) ; Swinburne University of Technology(斯威本科技大学) ; EPFL(洛桑联邦理工学院)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。
CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)
AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。
Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral
OmniPilot: 面向异构GPU集群的不确定性感知LLM推理顾问
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出OmniPilot,通过共形校准分位数成本模型和分布外弃权层,为异构GPU集群上的LLM服务选择最优配置,预测吞吐量MAPE为6.2%,top-1准确率95%。
Comments 10 pages, 3 figures, 3 tables
ComplianceGate: 分类器门控的多层LLM路由用于受监管行业的推理
机构 * Independent AI Researcher, India(印度独立人工智能研究员)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出分类器门控路由架构,在推理前评估查询复杂度和数据敏感性,将含PII的查询路由到本地端点,简单查询路由到小型模型,实现合规与成本效率。
更小的模型,意外的代价:LLM量化在自动程序修复中的权衡
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)
AI总结 研究LLM量化在自动程序修复中的效果,发现量化虽减少内存但增加推理时间和能耗,且修复问题集差异大,权衡受模型架构和任务复杂度影响。
Comments Accepted for publication in the Research Papers Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
从点击到意图:基于LLM提炼分类法的跨平台会话嵌入用于金融服务推荐
机构 * Capital One
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对金融服务中网页匿名浏览与移动端登录行为差异导致的意图信号利用不足问题,提出自监督Transformer编码会话嵌入与LLM提炼分类法生成可解释标签的双用途框架,在移动端首页排序和用户转化预测任务上显著提升性能。
Comments Dianjing Fan and Yao Li equally contributed to this work. 7 pages, 1 figure
长程LLM推理的上下文回收
机构 * Independent Researcher(独立研究员)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。
参数高效神经进化用于多样化大语言模型生成:通过提示嵌入进化实现质量-多样性优化
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出QD-LLM框架,通过进化提示嵌入实现参数高效神经进化,提升大语言模型生成质量与多样性,实验显示其在多个基准测试中表现优异。
Comments 11 pages, 3 figures, 7 tables, 1 algorithm, 1 theorem. Accepted to GECCO 2026
LLM特征可能损害GNN:同配图基准上的拼接干扰
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现将LLM特征通过纯输入拼接(而非联合训练)引入图神经网络时,会在同配基准上系统性地降低准确率,并提出了一个基于LLM单独判别性指标Delta_sig来预测拼接效果。
Comments 29 pages, 8 figures
可训练平滑旋转变换与学习通道尺度用于LLM量化
机构 * Doctoral School of Applied Informatics and Applied Mathematics, Obuda University(应用信息学与应用数学博士学校,奥布达大学) ; John von Neumann Faculty of Informatics, Obuda University(约翰·冯·诺伊曼信息学系,奥布达大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对大语言模型量化中激活值量化困难的问题,提出基于分位数鲁棒的缩放策略和梯度优化的通道尺度学习,在W4A4量化下显著降低误差。
Comments 6 pages, 8 figures, 3 tables. Accepted to IEEE INES 2026 conference proceedings
电子商务中多任务排序的相关性与参与度联合优化与高效LLM监督
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一个生产级多任务排序系统,通过序数相关头与统一价值模型联合优化相关性和参与度,并利用微调轻量级LLM生成三级序数相关标签,显著提升语义对齐同时保持核心参与目标。
重新思考层冗余:校准比搜索在LLM深度剪枝中更重要
机构 * Neural Superintelligence Lab, MODULABS(神经超智能实验室,MODULABS) ; University of Southern California(南加州大学) ; Boston University(波士顿大学) ; Seoul National University(首尔国立大学) ; Inha University(inha大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实验发现,在大型语言模型深度剪枝中,校准配置对剪枝模式和性能的影响远大于搜索算法的选择。
Comments Preprint
诊断LLM强化学习中的训练推断不匹配
机构 * ByteDance(字节跳动) ; The University of Virginia(弗吉尼亚大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示LLM强化学习中训练与推断阶段的不匹配问题,通过VeXact实验显示微小数值差异可能导致训练崩溃,并提出缓解措施。