A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
Comments 7 pages, 6 figures; to be presented at IEEE International Conference on Machine Learning for Communication and Networking (ICMLCN) 2025
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)
基于大语言模型的视觉编码器分层预训练
机构 * University of Cincinnati(辛辛那提大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。
Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026
ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG
AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。
Comments 16 pages, 8 figures
GRINQH:基于分级输入的量化层次结构用于高效LLM生成
机构 * Fakultät für Informatik, RWTH Aachen(亚琛工业大学计算机科学系) ; Fakultät für Elektrotechnik und Informationstechnik, RWTH Aachen(亚琛工业大学电气工程与信息技术系) ; Peter Grünberg Institut, Forschungszentrum Jülich GmbH(于利希研究中心彼得·格林贝格研究所)
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出GRINQH框架,利用激活幅度动态分配权重通道精度,统一量化与稀疏化,加速LLM解码阶段,在Llama3和Qwen3上优于现有方法,实现2位生成。
Frontier: 向全面且准确的LLM推理模拟迈进
机构 * The Chinese University of Hong Kong(香港中文大学) ; Anuttacon ; StepFun
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。
UltraSketchLLM:基于草图与硬件友好算子的低于1比特LLM压缩
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; School of Electronic Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) ; Center for Energy-efficient Computing and Applications, Peking University(能效计算与应用中心,北京大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出UltraSketchLLM,利用数据草图将LLM权重压缩至0.5比特,结合硬件友好实现,在保持可接受性能下降的同时实现14.9倍加速。
Comments Accepted by the 63rd ACM/IEEE The Chips to Systems Conference (DAC 2026)
AAAC: 面向4位LLM权重量化的激活感知自适应码本
机构 * University of Waterloo(滑铁卢大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出AAAC方法,通过每层两个小型学习码本(64字节)替代固定标量码本,以激活加权重建误差最小化选择码本,实现零额外存储开销的4位权重量化,在3-30分钟内完成量化,精度优于现有方法。
基于动态稀疏性的内存高效LLM训练:从稳定性到实际扩展
机构 * University of Waterloo(滑铁卢大学) ; University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Michigan(密歇根大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SMET方法,通过优化器预热和密度感知学习率缩放解决动态稀疏训练中的优化不稳定问题,实现LLM的稳定、可扩展且内存高效的稀疏预训练。
Comments Accepted at ICML2026
InfoQuant:为低比特LLM量化塑造激活分布
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Ant Group(蚂蚁集团) ; College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) ; China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) ; Alibaba Cloud Computing(阿里云计算) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对低比特激活量化中分布与量化器不匹配的问题,提出基于信息论的分析和无需训练的峰值抑制正交变换(PSOT)方法,显著提升量化精度。
SafeCtrl-RL: 通过RL驱动的提示优化的LLM对话推理时自适应行为控制
机构 * School of Computing, Engineering and Building Environment(计算、工程与建筑环境学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SafeCtrl-RL框架,利用强化学习在推理时动态选择提示调整策略,无需重新训练即可抑制不安全行为,提升LLM对话的安全性和响应质量。
LLM介导的普适系统中的权威倒置:当模型信任用户胜过传感器
机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ; School of Computer Science(计算机科学学院) ; Engineering, South China University of Technology(华南理工大学工程学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究揭示了大语言模型在融合传感器与用户冲突信息时,由于格式依赖性导致数值传感器数据被自然语言用户主张支配的权威倒置现象,并提出了几何框架、审计指标(CIR和AAI)以及推理时层干预方法(GAC)来诊断和缓解该问题。
从参数到数据:一种任务参数引导的微调流水线用于高效的LLM对齐
机构 * Zhejiang University(浙江大学) ; Eastern Institute of Technology(东部技术研究所)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出了一种任务参数引导的微调流水线,通过任务敏感的注意力头作为双指南,实现样本挖掘和结构剪枝,从而提高LLM对齐的效率。
Comments Accepted@ICML26, 28 pages, 11 figures, 26 tables
网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理
机构 * Microsoft Research(微软研究院) ; UC Santa Cruz(加州大学圣克鲁兹分校)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。
Comments 19 pages, 11 figures, 5 tables
在LLM压缩中寻找免费午餐:重新审视剪枝后的重新训练
机构 * Department for AI in Society, Science, and Technology, Zuse Institute Berlin(人工智能社会、科学与技术系,柏林Zuse研究所) ; Institute of Mathematics, Technische Universität Berlin(数学系,柏林技术大学)
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在剪枝后通过局部重建进行适应的方法,发现其在减少数据和计算成本的同时能有效提升模型性能,并揭示了在不同粒度下重建参数窗口对最终质量的影响,挑战了LLM剪枝后适应不可行的主流观点。
ProxyKV:跨模型代理剪枝用于高效长上下文LLM推理
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 ProxyKV通过跨模型代理剪枝方法,解决LLM长上下文推理中的KV缓存内存瓶颈,实现高效推理与高精度的平衡,提升预填充速度和长上下文处理能力。
CATS:基于内存限制的LLM推理加速的级联自适应树推测
机构 * University of Florida(佛罗里达大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 CATS通过级联验证和修正机制,在内存受限设备中优化LLM推理,提升吞吐量并保持内存足迹。
CommFuse:通过通信分解与融合隐藏尾部延迟以分布式LLM训练
机构 * Huawei(华为)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CommFuse方法,通过分解与融合通信操作,有效缓解分布式LLM训练中的通信瓶颈,降低延迟并提升模型利用率。
Comments Slightly modified the title, and corresponding minor wording change in the content
Lightning OPD: 为大推理模型高效实现离线在线蒸馏
机构 * NVIDIA
专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)
AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。
知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器
机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) ; Nanyang Technological University(南洋理工大学) ; Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) ; AGH University of Krakow(克拉科夫AGH大学) ; SAN University(SAN大学)
专题命中 效率与部署 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。
ProTrain: 通过内存感知技术实现高效的LLM训练
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ProTrain系统,通过自动调整内存管理策略提升LLM训练效率,无需人工干预,实验显示训练吞吐量提升1.43至2.71倍。
Comments Accepted to MLSys 2026
机构 * Universidad Nacional de Colombia(哥伦比亚国立大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.LG
Comments Based on master's thesis in Systems and Computer Engineering, Universidad Nacional de Colombia (2025)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI、cs.LG
Comments Accepted for presentation(Poster) at PPAI-25: The 6th AAAI Workshop on Privacy-Preserving Artificial Intelligence
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title);分类 cs.CL、cs.LG
Comments 11 pages, 9 figures
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.LG
Comments Accepted by NeurIPS 2024
测量五九可靠性:在饱和基准上的样本高效LLM评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出通过交叉熵方法学习失败倾向输入分布,显著减少LLM评估所需推理次数,揭示模型在标准基准上表现相近但可靠性差异显著的问题。
Comments Project page: https://five-nines-reliability.notion.site/Measuring-Five-Nines-Reliability-Sample-Efficient-LLM-Evaluation-in-Saturated-Benchmarks-312b998d4f39802d88c0e9886db1b9cd
语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。
Comments Under review. 12 pages, 13 figures
通过潜在蒸馏探索大语言模型
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(人工智能通用基础理论国家重点实验室,BIGAI,北京,中国) ; School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海交通大学,上海,中国)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Exploratory Sampling方法,通过蒸馏模型引导生成过程,提升语义多样性与推理效率,在数学、科学和代码生成中表现优异。
Comments 25 pages, 5 figures. Accepted in ICML 2026