arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2605.05401 2026-05-08 cs.HC 90%

Why Someone Asked "Why": Foil Inference in Human and LLM Question Interpretation

为何有人问“为何”:人类和LLM的问题解读中的 foil 推理

Britt Besch, Tobias Gerstenberg

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨人类和LLM如何通过 hindsight expectation 判断 why 问题的 foil,发现人类选择 foil 的最佳预测因素是 hindsight expectation,而 LLM 的显式期望判断与 foil 选择存在不一致。

Comments Accepted at Proceedings of the 48th Annual Conference of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20919 2026-04-24 cs.IT math.IT 90%

DiP-SD: Distributed Pipelined Speculative Decoding for Efficient LLM Inference at the Edge

DiP-SD:分布式流水线推测解码用于边缘高效LLM推理

Yaodan Xu, Sheng Zhou, Zhisheng Niu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DiP-SD,通过设备级分布式生成与阶段级生成-验证流水线,优化边缘多用户LLM推理的吞吐量,实现比自回归解码高17.89倍的性能。

Comments Accepted by 2026 IEEE 103rd Vehicular Technology Conference (VTC2026-Spring)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15022 2026-04-17 cs.CR cs.AI cs.CL cs.LG 90%

Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization

通往罗马的攻击:通过对抗性后缀优化引导LLM路由器选择昂贵模型

Haochun Tang, Yuliang Yan, Jiahua Lu, Huaxiao Liu, Enyan Dai

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(符号计算与知识工程重点实验室,MoE,吉林大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出R$^2$A方法,通过对抗性后缀优化误导黑盒LLM路由器选择昂贵模型,解决现有攻击在黑盒场景下的不足。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07667 2026-04-17 cs.CL cs.AI cs.LG 90%

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

针对LLM推理中分层令牌剪枝的自适应层选择

Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

机构 * NEC Corporation(日本电报电话株式会社) Osaka University(大阪大学) Nagoya University(名古屋大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ASL方法,通过自适应选择KV缓存中的层,平衡不同任务性能并满足KV预算要求,优于现有分层令牌剪枝方法。

Comments ACL 2026 Findings. Source code available at https://github.com/TANIGUCHIREI/ASL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13066 2026-04-16 cs.CL cs.AI cs.LG 90%

Lossless Prompt Compression via Dictionary-Encoding and In-Context Learning: Enabling Cost-Effective LLM Analysis of Repetitive Data

通过字典编码和上下文学习实现无损提示压缩:使LLM能够高效分析重复数据

Andresa Rodrigues de Campos, David Lee, Imry Kissos, Piyush Paritosh

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无损提示压缩方法,利用字典编码和上下文学习,无需微调即可高效分析重复数据,压缩比达80%且保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08878 2025-10-23 cs.HC 90%

Knowledge Prompting: How Knowledge Engineers Use Large Language Models

Elisavet Koutsiana, Johanna Walker, Michelle Nwachukwu, Bohui Zhang, Albert Meroño-Peñuela, Elena Simperl

专题命中 效率与部署 :prompting(title,abstract);large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14800 2024-05-31 cs.CL cs.AI cs.LG 90%

Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models

Xudong Lu, Qi Liu, Yuhui Xu, Aojun Zhou, Siyuan Huang, Bo Zhang, Junchi Yan, Hongsheng Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Mixture-of-Experts Large Language Models, ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04632 2026-08-11 cs.DB cs.AI 90%

Conceptual Schema Inference for Tabular Datasets using Large Language Models

使用大型语言模型对表格数据集进行概念模式推断

Zhenyu Wu, Jiaoyan Chen, Norman W. Paton

机构 * The University of Manchester(曼彻斯特大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两种基于大型语言模型的方法,从原始表格中自动推断概念模式,包括实体类型、属性和类型间关系,以解决异构表格数据的一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 90%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-08-04 cs.LG 新提交 90%

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27698 2026-07-31 cs.AI cs.NE 新提交 90%

Guiding Large Language Models with Genetic Programming-Evolved Heuristic Knowledge for Dynamic Multi-Mode Project Scheduling

用遗传编程演化的启发式知识指导大语言模型解决动态多模式项目调度问题

Yuan Tian, Yi Mei, Mengjie Zhang

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) School of Engineering and Computer Science(工程与计算机科学学院) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究将遗传编程演化的调度规则知识反向转移,通过四种机制指导大语言模型决策,提升了调度性能、决策稳定性并降低 token 消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25227 2026-07-29 cs.CR cs.LG 新提交 90%

Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

决策级劫持:通过位翻转攻击向大语言模型注入认知偏差

Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究大语言模型在高风险决策场景中的决策级劫持问题,提出CogBias框架,利用位翻转攻击,通过可微情感评估器等将主观偏好转化为优化信号,经实验验证该方法能在少量位翻转下诱导目标主题立场转变,破坏模型价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24312 2026-07-28 cs.CL 新提交 90%

CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

CONSISTRE:用于文档级关系抽取的统一一致性感知框架及大语言模型

Mingxuan Sun

机构 * Université de Sherbrooke(舍布鲁克大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究针对文档级关系抽取中,大语言模型预测易违反关系约束的问题,提出CONSISTRE统一框架。通过推理时的约束感知等及训练时的知识蒸馏强化学习两条路径解决,实验表明该框架有效提升性能,缩小开源与专有模型差距,增强可靠性。

Comments 13 pages, 2 figures. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15865 2026-07-28 cs.CL 版本更新 90%

An MLIR-Based Compilation Method for Large Language Models

一种基于MLIR的大语言模型编译方法

Pengchao Hu, Zhibin Xin, Yifan Chen, Yangyang Zhou, Liang Wang, Xin Zhang

机构 * Sophgo Inc(算能科技有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大语言模型在专用硬件部署的挑战,提出基于MLIR的编译方法,用TopOp和TpuOp方言表示模型,分阶段编译,在TPU-MLIR编译器等项目实现,支持多种模型及量化部署形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18034 2026-07-23 cs.AI 版本更新 90%

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

AdaHome:一种使用本地小语言模型的自适应智能家居助手

Eu Jin Lim, Zhaoxing Li, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14230 2026-07-21 cs.LG 版本更新 90%

NIRVANA: Structured Pruning Reimagined for Large Language Model Compression

NIRVANA:为大语言模型压缩重新构想的结构化剪枝

Mengting Ai, Tianxin Wei, Sirui Chen, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究针对大语言模型结构化剪枝中性能下降等问题,提出NIRVANA框架。通过函数空间显著性评估结构重要性,引入全局单元排序等策略,消除随机采样不稳定问题,在多架构上广泛评估,取得新的最优结果,为模型压缩提供实用方法。

Comments Accepted to COLM 2026. Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09172 2026-07-14 cs.LG 版本更新 90%

BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning

BalDRO:一种基于分布鲁棒优化的大语言模型遗忘框架

Pengyang Shao, Naixin Zhai, Lei Chen, Yonghui Yang, Fengbin Zhu, Xun Yang, Meng Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对大语言模型遗忘中样本不均衡问题,提出BalDRO框架,将遗忘设为最小-上确界过程,通过内、外步更新参数,经BalDRO-G和BalDRO-DV变体实例化,实验显示其在遗忘质量和模型效用上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01394 2026-07-03 cs.AI 新提交 90%

The Wiola Architecture for Efficient Small Language Models

Wiola架构:高效小型语言模型

Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi, Brahma Kumar

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Wiola小型语言模型架构,包含五种原创组件,在多个规模上超越GPT-2、LLaMA-2和Mistral。

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 90%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31602 2026-07-02 cs.CL cs.CR 新提交 90%

Robust Text Watermarking for Large Language Models via Dual Semantic Embeddings

基于双语义嵌入的大型语言模型鲁棒文本水印

Jonas Schäfer, Cezary Pilaszewicz, Gerhard Wunder

机构 * Freie Universität Berlin(柏林自由大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出双嵌入水印(DEW),利用上下文和词级嵌入增强对释义和翻译的鲁棒性,通过伪随机矩阵投影隐藏水印,实验表明DEW在保持文本质量的同时提升检测性能。

Comments Preprint. 22 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18195 2026-06-26 cs.CL 新提交 90%

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

专题命中 效率与部署 :SFT(summary_cn,abstract);LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00482 2026-06-16 cs.LG 版本更新 90%

AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models

AREAL-DTA:用于大语言模型高效强化学习的动态树注意力机制

Jiarui Zhang, Yuchen Yang, Ran Yan, Zhiyu Mei, Liyuan Zhang, Daifeng Li, Wei Fu, Jiaxuan Gao, Shusheng Xu, Yi Wu, Binhang Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);post-training(abstract)

AI总结 针对RL后训练中rollout序列共享前缀导致计算冗余的问题,提出基于深度优先搜索的动态树注意力机制,结合负载均衡分布式批处理,实现高效前缀共享,训练吞吐量提升最高8.31倍。

Comments Accepted at ICML 2026. Camera-ready version. Code: https://github.com/areal-project/AReaL/tree/feat/dta

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12203 2026-06-11 cs.CL 新提交 90%

Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

自适应多分辨率程序性知识压缩用于大型语言模型

Changyue Wang, Weihang Su, Qingyao Ai, Yichen Tang, Runzhong Qiao, Xuancheng Li, Min Zhang, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SKIM框架,通过自适应多分辨率软令牌压缩程序性技能,在保持任务性能的同时将技能令牌长度压缩至30%-60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09543 2026-06-10 cs.SE cs.AI 90%

SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs

SWEnergy:关于使用SLM的代理问题解决框架的能量效率实证研究

Arihant Tripathy, Ch Pavan Harshit, Karthik Vaidhyanathan

机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴研究所)

专题命中 效率与部署 :SLM(title_cn,summary_cn);LLM(abstract);language model(abstract);small language model(abstract)

AI总结 本文通过实证研究,探讨了四种主流代理问题解决框架在使用小型语言模型时的能量效率和资源消耗,发现框架架构是主要能耗驱动因素,但SLM的有限推理能力导致大量能耗浪费。

Comments 8 pages, 5 figures, 1 table. Accepted to AGENT 2026 (ICSE 2026 workshop)

Journal ref Proceedings of the 2026 International Workshop on Agentic Engineering (AGENT 2026), ACM, 2026, pp. 104-111

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08197 2026-06-09 cs.CL cs.DC 新提交 90%

AlignFed: Alignment-Aware Asynchronous Federated Fine-Tuning for Large Language Models in Heterogeneous Edge Environments

AlignFed: 异构边缘环境中大语言模型的对齐感知异步联邦微调

Yan Wang, Ziyi Gao, Rui Wang

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出AlignFed框架,通过多阶段语义对齐机制(版本感知更新分组、跨版本语义对齐、公平性感知聚合)解决异步联邦微调中大语言模型在异构边缘环境中的模型漂移、客户端漂移和聚合不公平问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07857 2026-06-09 cs.CR cs.AI 新提交 90%

Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices

边缘设备上小语言模型训练中对抗检测的模型多重性

Stefan Behfar, Richard Mortier

机构 * Computer Lab, University of Cambridge(剑桥大学计算机实验室)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对边缘设备上分布式微调语言模型易受投毒攻击的问题,提出基于模型多重性的系统级防御,通过旋转或并行训练多个小语言模型并量化其差异来检测异常,实验表明比经典单模型防御更早更可靠地检测投毒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05004 2026-06-04 cs.CR cs.AI 90%

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

SharedRequest: 面向大型语言模型的隐私保护模型无关推理

Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang

机构 * National University of Singapore (Chongqing) Research Institute(新加坡国立大学(重庆)研究院) Chongqing Key Laboratory of Trusted Perception and Interaction Technology for Intelligent and Connected Vehicles(重庆智能网联车辆可信感知与交互技术重点实验室) National University of Singapore(新加坡国立大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) State Key Laboratory of Intelligent Vehicle Safety Technology, Chongqing, China(重庆智能车辆安全技术国家重点实验室) CHONGQING CHANGAN AUTOMOBILE Co., Ltd(重庆长安汽车有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种模型无关的隐私保护推理框架SharedRequest,通过批量级别混淆和语义分组实现高效隐私保护,相比差分隐私基线效用提升20%以上,查询成本降低5倍。

Comments accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17709 2026-06-04 cs.CL cs.DC 90%

DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

DeInfer:分解式大语言模型的高效并行推理

You-Liang Huang, Xinhao Huang, Chengxi Liao, Zeyi Wen

机构 * Boston University(波士顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对分解式大语言模型并行推理性能差的问题,提出DeInfer系统,通过多项优化实现高性能并行推理,实验证明其优越性。

Comments accepted by DAC'26, latest version fixs a minor mistake

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02823 2026-06-03 cs.LG 90%

Qift: Shift-Friendly No-Zero W2 Post-Training Quantization for Rotated W2A4/KV4 LLM Inference

Qift: 面向旋转W2A4/KV4 LLM推理的移位友好型无零W2后训练量化

Chi-Wei Huang, Chia-Chi Tsai

机构 * National Cheng Kung University(国立成功大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(title);分类 cs.LG

AI总结 针对旋转量化流水线中W2A4/KV4设置下标准W2电平集性能不佳的问题,提出一种基于零中心高斯源模型的无零固定W2电平集Qift,通过重新设计码本映射实现无训练、无学习码本、无组网格、无零点的量化,显著提升模型困惑度和下游精度。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15572 2026-06-03 cs.CL 90%

Measuring Maximum Activations in Open Large Language Models

测量开放大型语言模型中的最大激活值

Luxuan Chen, Han Tian, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Linghe Kong, Dawei Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Nankai University(南开大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 本研究通过统一流程测量8个开放LLM家族的27个检查点中的全局和逐层最大激活值,发现其跨家族、架构和训练阶段差异显著,且与低比特量化误差相关,建议在发布开放权重时报告该指标。

详情

展开后加载摘要…

URL PDF HTML 收藏