arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2411.08610 2024-11-14 cs.CL cs.LG 89%

Dynamic Subset Tuning: Expanding the Operational Range of Parameter-Efficient Training for Large Language Models

Felix Stahlberg, Jared Lichtarge, Shankar Kumar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;foundation model(comments)

Comments NeurIPS 2024 Workshop on Adaptive Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07046 2023-12-13 cs.LG cs.CL 89%

Rethinking Compression: Reduced Order Modelling of Latent Features in Large Language Models

Arnav Chavan, Nahush Lele, Deepak Gupta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;LLM(comments)

Comments Brief technical report; Code will be made available at https://github.com/transmuteAI/trailmet/tree/main/trailmet/algorithms/llm-rom

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19670 2026-08-21 cs.CL 新提交 89%

The Asymmetric Harms of LLM Compression

大语言模型压缩的非对称危害

Yuan Wu, Mairui Li, Lesia Semenova, Chudi Zhong

机构 * Rice University(莱斯大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过评估3个LLM、11种压缩方法,发现LLM压缩会引发知识保留、置信度及偏见的非对称变化,聚合指标无法捕捉,需对压缩模型开展细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17336 2026-08-19 cs.AI 新提交 89%

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix:面向大语言模型推理加速的以块为中心的混合精度注意力机制

Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

机构 * University of North Texas(北得克萨斯大学) Saint Louis University(圣路易斯大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TileMix是一种以块为中心的混合精度注意力内核,通过硬件对齐的分数块路由实现LLM推理加速,可恢复长上下文质量并提升预填充吞吐量,支持多种模型与任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08156 2026-08-11 cs.LG cs.NE 新提交 89%

A Hybrid Nested Harness for Decoupling Structure and Parameters in LLM-Driven Optimization

用于解耦大语言模型驱动优化中结构与参数的混合嵌套框架

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术公司)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract);分类 cs.LG

AI总结 该研究提出混合嵌套框架解耦LLM驱动优化的结构与参数,外层LLM提结构草图、内层优化器调参,在三类任务中性能优于纯LLM及纯数值优化基线。

Comments Published as a conference paper at LM4Sci Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07427 2026-08-10 cs.AI cs.PF 新提交 89%

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

一图胜千词:视觉语言模型如何在提升准确率的同时降低AI能源成本

Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出将时间序列编码为二维图的视觉语言模型,可大幅减少输入词元、降低推理能耗,同时在电信异常检测等任务中提升准确率,解决了LLM处理多维度KPI数据的低效问题。

Comments Accepted at the 14th European Conference on Renewable Energy Systems (ECRES), July 7--9, 2026, London, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10317 2026-08-10 cs.RO cs.LG 版本更新 89%

Robot guide with multi-agent control and automatic scenario generation with LLM

基于多智能体控制与大语言模型自动场景生成的机器人引导系统

Elizaveta D. Moskovskaya, Anton D. Moscowsky

机构 * National Research Center "Kurchatov Institute"(国家研究快机构"库恰托夫研究所")

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究开发了结合多智能体资源管理与LLM自动场景生成的混合社交机器人控制架构,在MENTOR-1导游机器人上验证了其能提升长期讲故事任务中机器人交互的自然性与丰富度。

Comments 14 pages, 4 figures, 4 tables, 1 demo-video and repository link. There were major changes: an introduction, a review, and a new experiment. Some tables and figures have also been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06135 2026-08-07 cs.LG 新提交 89%

LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm

突发工作负载分布下的大语言模型推理:对WAIT算法的改进

Anjali Gangadhar Katageria, Shobha Rani, Raghu Nandan Sengupta

机构 * Indian Institute of Technology Dharwad(印度达尔瓦德印度理工学院) Indian Institute of Technology Kanpur(印度坎普尔印度理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLM推理中突发工作负载的问题,改进了WAIT算法,通过在线估计请求强度提升了低到达率变化场景下的吞吐量,且延迟与现有基准相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11083 2026-08-04 cs.LG cs.CR 版本更新 89%

Token-Efficient Change Detection in LLM APIs

LLM API中的令牌高效变化检测

Timothée Chauvin, Clément Lalanne, Erwan Le Merrer, Jean-Michel Loubes, François Taïani, Gilles Tredan

机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28966 2026-08-03 cs.CL 新提交 89%

BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

BLADE:用于高效大语言模型推理的边界扩展与层自适应动态出口

Keshu Fu, Keqin Peng, Jun Bai, Shuhan Qin, Chen Li, Junzhu Liang, Yefei Chen, Jiaqi Li, Yuanxin Ouyang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BLADE是一种轻量级框架,通过构建多粒度检查点、学习紧凑探测层子集等,在保持接近基线准确率的同时,减少大语言模型的推理计算与生成令牌量,提升了LLM推理效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 89%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00086 2026-07-09 cs.CL 版本更新 89%

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 效率与部署 :language agent(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。

Comments Published as a long paper in the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 89%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27457 2026-06-29 cs.PF cs.CL 新提交 89%

Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

聚类、路由、升级:成本感知的LLM服务级联框架

Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie, Alexandros Agapitos, Aleksandar Milenovic, Hongmeng Song, Yucheng Shi, Yue Pan, Patricia Buffini, John D. Kelleher

机构 * ADAPT Centre, Trinity College Dublin(ADAPT中心,都柏林信任学院) Huawei Research(华为研究)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出两阶段级联框架,通过聚类分配查询到最经济的模型,并利用质量估计升级低质量输出,在保持97-99%准确率的同时降低每输出token时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 89%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22642 2026-06-23 cs.LG 版本更新 89%

Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning

压缩简单问题,探索困难问题:面向高效LLM推理的难度感知熵正则化

Qin-Wen Luo, Sheng Ren, Xiang Chen, Rui Liu, Jun Fang, Naiqiang Tan, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) College of Computer Science and Technology(计算机科学与技术学院) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CEEH方法,通过难度感知的熵正则化,在强化学习中对简单问题压缩推理长度,对困难问题保持探索空间,从而在减少响应长度的同时维持推理准确性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11418 2026-06-16 cs.CL 版本更新 89%

CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering

CentroidKV: 通过KV缓存聚类实现高效的长上下文LLM推理

Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CentroidKV框架,通过在线聚类KV缓存减少内存占用,在保持性能的同时实现高达75%的缓存压缩和1.92倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 89%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 89%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08129 2026-06-09 cs.AI 新提交 89%

Cross-LLM Consistency in Inference: Evidence from Shared Interactions

推理中的跨LLM一致性:来自共享交互的证据

Siyu Lou, Yao Yan, Yuntian Chen, Quanshi Zhang

机构 * School of Computer Science Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ningbo Key Laboratory of Advanced Manufacturing Simulation Eastern Institute of Technology, Ningbo(宁波市先进制造仿真重点实验室,宁波东方理工大学) College of Computer and Information Science Chongqing Normal University(重庆师范大学计算机与信息科学学院) SymtrustAI.com Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,不同大型语言模型在相同提示下预测相同目标词时,常共享交互模式,且高级模型一致性更强,共享交互通常阶数更低、正负抵消更弱。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01609 2026-06-09 cs.CL 版本更新 89%

Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression

Swift-SVD:在低秩LLM压缩中理论最优与实用效率的结合

Ruoling Qi, Yirui Liu, Xuaner Wu, Xiangyu Wang, Ming Li, Chen Chen, Jian Chen, Yin Chen, Qizhen Weng

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Swift-SVD框架,通过激活感知和闭式压缩方法,在保证理论最优的同时提升实用效率和数值稳定性,实验显示其在压缩精度和端到端压缩时间上有显著优势。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28115 2026-05-28 cs.AI 89%

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC: 面向高效视觉语言模型的端到端序列紧凑性

Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

机构 * Department of Civil & Environmental Engineering(土木与环境工程系) University of Utah(犹他大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出CIVIC框架,通过路径一致的紧凑视觉推理,在视觉编码器、投影层、LLM预填充和KV缓存中保持紧凑序列表示,减少非连续内存访问和局部合并开销,在Qwen3-VL架构上实现KV缓存内存降至约三分之一并降低端到端推理延迟,同时通过文本对齐KL蒸馏和自适应空间保留下限保持精度。

Comments 11 pages, 6 figures, 2 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27763 2026-05-28 cs.LG 89%

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving

LLM服务中基于批处理条件的拒绝鲁棒性配对测试协议

Sahil Kadadekar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 提出配对测试协议,通过四项研究验证批处理条件对LLM安全标签的影响,发现批处理导致的安全标签翻转率低但存在,建议精确堆栈验证。

Comments 12 pages. Accepted to the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18692 2026-05-28 cs.AI math.OC 89%

Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches

利用LLM引导的模型补丁实现大规模重新优化的大众化

Tinghan Ye, Arnaud Deza, Ved Mohan, El Mehdi Er Raqabi, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(赫尔曼·米利特·斯图尔特工业与系统工程学院,佐治亚理工学院) Department of Operations and Decision Systems, Université Laval(运营与决策系统系,拉瓦尔大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的代理重新优化框架,通过自然语言交互和优化工具箱,使非专家用户能够动态更新和重新优化部署的优化模型,并在两个大规模实际案例中验证了其有效性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09557 2026-05-21 cs.DC cs.LG 89%

Understanding and Improving Communication Performance in Multi-node LLM Inference

理解并改进多节点LLM推理中的通信性能

Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

机构 * Department of Computer Science, University of Maryland(马里兰大学计算机科学系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究探讨了多节点分布式推理中通信性能的优化,通过分析不同模型并行方案的强标度行为,提出了一种基于递归倍增的分层all-reduce算法NVRAR,显著降低了推理延迟。

Comments 17 Figures, To Appear in Proceedings of ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01752 2026-05-11 cs.CL cs.CR 89%

WorldCup Sampling for Multi-bit LLM Watermarking

多比特LLM水印的WorldCup采样

Yidan Wang, Yubing Ren, Yanan Cao, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WorldCup框架,通过结构化通信通道建模和分层竞争机制实现多比特水印嵌入,提升文本质量和解码鲁棒性,实验表明其在容量、检测性、鲁棒性等方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27296 2026-05-01 cs.SE cs.CL 89%

To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

要进行差异生成还是不进行差异生成?面向高效LLM代码编辑的结构感知和自适应输出格式

Wei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BlockDiff和FuncDiff两种结构感知差异格式及AdaEdit策略,通过减少生成复杂度提升长代码编辑效率,准确度与全代码生成相当,降低30%以上延迟和成本。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27032 2026-05-01 cs.SE cs.LG 89%

LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference

基于大语言模型的运行时参数优化以实现高效模型推理

Katelyn Crumpacker, Dimitrios Nikolopoulos

机构 * Virginia Polytechnic and State University(弗吉尼亚理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种结合人类反馈和大语言模型的运行时参数优化方法,以提高模型推理的能效,通过迭代优化快速找到高效参数配置。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14590 2026-04-23 cs.LG 89%

MixLLM: LLM Quantization with Global Mixed-precision between Output-features and Highly-efficient System Design

MixLLM: LLM量化与输出特征间全局混合精度的高效系统设计

Zhen Zheng, Xiaonan Song, Chuanjie Liu

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 MixLLM通过全局混合精度量化优化输出特征,提升LLM压缩精度与系统效率,实验显示在增加10%比特数下, perplexity和MMLU-Pro损失显著降低。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13806 2026-04-16 cs.LG 89%

Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate

鲁棒超低比特后训练量化 via 稳定对角曲率估计

Jaemin Kim, Sungkyun Kim, Junyeol Lee, Jiwon Seo

机构 * Seoul National University(首尔国立大学) Hanyang University(翰阳大学)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DASH-Q框架,通过使用对角Hessian近似和迭代加权最小二乘法,在超低比特条件下提升零样本准确率,实现更稳定的量化效果。

Comments EUROMLSYS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏