arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 77 篇

2605.28268 2026-05-28 cs.DB 88%

Towards Cost-effective LLMs Routing with Batch Prompting

面向成本效益的批量提示大语言模型路由

Haotian Xu, Kangfei Zhao, Jiadong Xie

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RoBatch框架,联合优化模型分配和查询聚合两个维度,在成本预算下实现更优的成本-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28051 2026-05-28 cs.CV 88%

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) CUHK MMLab(香港中文大学MMLab) CPII under InnoHK(创新工场CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15390 2026-05-28 cs.CV 88%

Automatic Pruning Discovery for Large Language Models

大型语言模型的自动剪枝发现

Haidong Kang, Lihong Lin, Enneng Yang, Hongning Dai, Hao Wang

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University at Qinhuangdao 066004, Hebei Province, China(河北省海洋感知网络与数据处理重点实验室,秦皇岛东北大学066004,河北省) Sun Yat-sen University, Shenzhen, China(深圳大学) Hong Kong Baptist University, Hongkong, China(香港 Baptist 大学) Xidian University, Xian, China(西安电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 提出AutoPrune方法,利用LLMs自动设计剪枝算法,并通过图驱动思维链优化提示,结合偏态感知动态稀疏分配解决高剪枝率下的异常值问题,在主流基准上超越现有方法。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28557 2026-05-28 cs.LO cs.AI 87%

Token Optimization Strategies for LLM-Based Oracle-to-PostgreSQL Migration

基于LLM的Oracle到PostgreSQL迁移的Token优化策略

Oleg Grynets, Dmytro Babarytskyi, Vasyl Lyashkevych

机构 * EPAM Systems(EPAM系统) Kharkiv, Ukraine(乌克兰基尔基茨) Lviv, Ukraine(乌克兰利沃夫) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文形式化并评估了十二种Token优化策略,在Oracle到PostgreSQL迁移中平衡成本、语法有效性、语义保持和结构保真度。

Comments 11 pages, 3 figures, 5 tables, 38 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28224 2026-05-28 cs.AI 87%

When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?

何时记忆有助于工具使用LLM代理的多轨迹推理?

Xinzhe Li, Yaguang Tao

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个统一框架,将记忆沿传输范围和内容抽象两个维度分解,在无验证器设置下评估四种记忆方法与三种推理策略在四个工具使用基准上的表现,发现推理策略是混淆变量,不同策略下相同记忆方法产生显著不同结果。

Comments More evaluation and analysis are on the way

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27899 2026-05-28 cs.AI 87%

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

SKILLC: 通过对比信用分配学习LLM智能体的自主技能内化

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SkillC框架,基于对比技能信用分配(CSCA)将技能帮助性对比转化为直接学习信号,实现LLM智能体的自主技能内化,在ALFWorld和WebShop上分别超越最强基线5.5%和4.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27823 2026-05-28 cs.CR cs.AI cs.CV 87%

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

解耦对抗性提示:基于语义图的鲁棒大语言模型安全防御

Xiang Fang, Wanlong Fang

机构 * Xiang Fang(1. 方翔) Wanlong Fang(2. 方万龙)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出对抗性提示解耦(APD)框架,通过互信息语义分解、图谱分析和轻量级分类器,在输入处理前识别并中和恶意组件,将有害输出减少85%以上。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06350 2026-05-28 cs.CL cs.AI cs.CR 87%

Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?

Mask-GCG:对抗性后缀中的所有标记对于越狱攻击都是必要的吗?

Junjie Mu, Zonghao Ying, Zhekui Fan, Zonglei Jing, Yaoyuan Zhang, Zhengmin Yu, Wenxin Zhang, Quanchen Zou, Xiangzheng Zhang

机构 * Politecnico di Milano(米兰理工学院) Beihang University(北京航空航天大学) East China Normal University(华东师范大学) Fudan University(复旦大学) University of the Chinese Academy of Sciences(中国科学院大学) AI Security Lab(360人工智能安全实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Mask-GCG方法,通过可学习的标记掩码识别后缀中高影响力标记并剪枝低影响力标记,降低计算开销并保持攻击成功率,揭示LLM提示中的标记冗余。

Comments Accepted to ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 13887-13891, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18893 2026-05-28 cs.CL cs.LG 87%

xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction

xKV:通过对齐奇异向量提取的跨层KV缓存压缩

Chi-Chih Chang, Wei-Cheng Lin, Chien-Yu Lin, Hung-Yueh Chiang, Yash Akhauri, Xilai Dai, Huiqiang Jiang, Yucheng Li, Luis Ceze, Kai-Chiang Wu, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学) Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Surrey(塞夫顿大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出xKV,一种通过跨层共享低秩子空间压缩KV缓存的后训练方法,实现高达8倍压缩且保持长上下文任务精度,并引入选择性重建实现端到端加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27740 2026-05-28 cs.CL 86%

UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training

UNIQUE: 通用Top-k稀疏注意力,用于免训练推理和稀疏感知训练

Keqi Deng, Shaoshi Ling, Ruchao Fan, Jinyu Li

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UNIQUE框架,通过基于键均值和标准差的页面重要性评分和软掩码稀疏感知训练,实现LLM长上下文推理中KV缓存的高效稀疏注意力,在保持任务性能的同时显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27432 2026-05-28 cs.IR cs.AI 86%

FD-RAG: Federated Dual-System Retrieval-Augmented Generation

FD-RAG: 联邦双系统检索增强生成

Tianhao Gao, Kai Yang, Yiyang Li

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FD-RAG框架,通过解耦轻量级记忆访问与按需LLM推理,并利用语义感知自适应超图蒸馏为紧凑QA记忆,在联邦设置下实现高效、隐私保护的检索增强生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05642 2026-05-28 cs.RO cs.AI 86%

Relational Semantic Reasoning on 3D Scene Graphs for Open World Interactive Object Search

基于3D场景图的开放世界交互式物体搜索的关系语义推理

Imen Mahdi, Matteo Cassinelli, Fabien Despinoy, Tim Welschehold, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SCOUT方法,通过从LLM蒸馏的关系探索启发式直接搜索3D场景图,实现高效开放世界交互式物体搜索,性能匹配LLM且计算高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28526 2026-05-28 cs.AI cs.CL 84%

Entropy-aware Masking for Masked Language Modeling

面向掩码语言建模的熵感知掩码策略

Gokul Srinivasagan, Kai Hartung, Munir Georges

机构 * AImotion Bavaria(AImotion巴伐利亚) Technische Hochschule Ingolstadt(英戈尔施塔特技术大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出基于熵分布的掩码策略,通过模型预测熵识别信息量高的token进行掩码,并引入自掩码方法提升训练效率,在GLUE上平均提升5%。

Comments accepted at starsem 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28283 2026-05-28 cs.CL cs.AI 84%

PrunePath: Towards Highly Structured Sparse Language Models

PrunePath:迈向高度结构化稀疏语言模型

Zhexuan Gu, Zixun Fu, Yancheng Yuan

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PrunePath框架,通过软最大归一化路由和累积质量阈值实现自适应预算的结构化稀疏化,在自然语言理解、生成和指令调优中取得优越的稀疏-性能权衡,并利用Triton内核将结构化稀疏转化为实际内存节省和解码速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27703 2026-05-28 cs.AI 83%

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

面向资源受限智能体语言模型的分层提示域控制与学习

Joan Vendrell Gallart, Russell Bent, Michael Grosskopf

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出分层控制与学习框架,通过蒸馏学习输出模式、在线监控与提示域控制,解决资源受限下智能体语言模型的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03515 2026-05-28 cs.LG cs.AI cs.DC 82%

Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation

通过基旋转缓解异步流水线并行中的陈旧性问题

Hyunji Jung, Sungbin Shin, Namhoon Lee

机构 * POSTECH(POSTECH大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对异步流水线并行中梯度陈旧性随流水线深度线性增长的问题,提出基旋转框架,通过将优化器坐标系与Hessian特征基对齐来保持延迟更新的有效性,理论证明最小化基失配并实证在3B参数LLM训练中减少81.7%迭代次数。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-05-28 cs.LG 81%

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27591 2026-05-28 cs.LG 81%

Gradient Transformer: Learning to Generate Updates for LLMs

梯度变换器:学习为大语言模型生成更新

Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA(数据科学系,新泽西理工学院,新泽西州诺克斯维尔) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所,HBKU,多哈)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种无数据知识蒸馏框架,利用梯度变换器将微调后小语言模型的更新向量转换为大语言模型的更新向量,实现无需私有数据即可更新大模型。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27428 2026-05-28 cs.LG 81%

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

$E^3$-Agent: 一种用于边缘生成式推理资源管理的可执行且可演化智能体

Rui Bao, Yaping Sun, Zhiyong Chen, Feng Yang, Meixia Tao, Nan Li, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学合作中位网创新中心,上海,中国) Department of Broadband Communication, Pengcheng Laboratory, Shenzhen 518000, China(鹏城实验室宽带通信部门,深圳,中国) China Mobile Research Institute, Beijing 100053, China(中国移动研究院,北京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对边缘生成式推理中设备性能未知且时变的问题,提出一种可执行且可演化的智能体$E^3$-Agent,通过分离快速路径路由器和慢速路径大语言模型元控制器,实现在线学习与自适应资源管理,在动态场景下平均延迟降低65%-73%。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04295 2026-05-28 cs.CL 81%

Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Generation

面向可靠专利权利要求生成的适应性成本高效评估

Yongmin Yoo, Qiongkai Xu, Longbing Cao

机构 * Frontier AI Research Centre, Macquarie University School of Computing, FSE, Macquarie University(前沿人工智能研究中心,麦考瑞大学计算机学院,FSE,麦考瑞大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出两阶段框架ACE,利用专利错误类别结构进行不确定性感知路由,第一阶段编码器预测错误类型熵,超过阈值则交由第二阶段专家LLM执行模式约束的专利思维链协议,在降低78%成本的同时超越70B参数LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09986 2026-05-28 stat.ML cs.CL cs.LG 81%

Federated Language Models Under Bandwidth Budgets: Distillation Rates and Conformal Coverage

带宽预算下的联邦语言模型:蒸馏率与共形覆盖

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究带宽受限节点间分布式语言模型的统计保证,提出联邦探针-对数蒸馏(FPLD)和联邦共形RAG(FC-RAG)两种协议,分别给出训练时的KL一致性率和推理时的无分布边际覆盖界,首次将带宽作为一阶统计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01807 2026-05-28 cs.CL cs.LG 81%

Sentence Curve Language Models

句子曲线语言模型

DongNyeong Heo, Taehwan Kim, Heeyoul Choi

机构 * Ulsan National Institute of Science and Technology(全南国立科学研究所) Handong Global University(翰昂全球大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出句子曲线表示,将扩散语言模型扩展为预测句子曲线而非静态词嵌入,以增强全局结构建模,并在IWSLT14和WMT14上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28087 2026-05-28 cs.RO 80%

Whose Is This?: Context-Aware Object Ownership Inference with Uncertainty-Guided Questioning

这是谁的?:基于不确定性引导提问的上下文感知物体所有权推断

Saki Hashimoto, Akira Taniguchi, Shoichi Hasegawa, Yoshinobu Hagiwara, Tadahiro Taniguchi

机构 * Kyutech(京都科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种结合大语言模型和共形预测的上下文感知所有权推断框架(COIN),通过不确定性引导的交互式提问,在模拟家庭环境中实现高精度物体所有权估计。

Comments Under review in Advanced Robotics. Project page is https://emergentsystemlabstudent.github.io/COIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 80%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract)

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11234 2026-05-28 cs.LG 79%

Neural Weight Compression for Language Models

语言模型的神经权重压缩

Jegwang Ryu, Minkyu Kim, Seungjun Shin, Hee Min Choi, Dokwan Oh, Jaeho Lee

机构 * POSTECH(POSTECH大学) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 提出神经权重压缩(NWC)框架,通过训练神经编解码器在预训练权重数据集上实现高效压缩,解决张量异质性和重建损失与下游性能不匹配问题,在4-6比特区间取得优异精度-压缩权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20439 2026-05-28 cs.CV cs.AI 79%

Object-Centric Vision Token Pruning for Vision Language Models

面向视觉语言模型的以对象为中心的视觉令牌剪枝

Guangyuan Li, Rongzhen Zhao, Jinhong Deng, Yanbo Wang, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Electronic Science and Technology of China(电子科学与技术大学) Delft University of Technology(代尔夫特理工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出OC-VTP方法,通过轻量预训练以对象为中心的视觉令牌剪枝器,直接选择最具代表性的视觉令牌,在保持高精度的同时提升VLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28567 2026-05-28 cs.LG cs.AI 79%

Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression

稀疏自编码器特征匹配与电路压缩的语义最优传输

Tue M. Cao, Nguyen Do, My T. Thai

机构 * University of Florida(佛罗里达大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于最优传输的分布框架,通过激活加权分布和Wasserstein距离统一解决跨层特征匹配与电路压缩问题。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07574 2026-05-28 cs.CV cs.CL 77%

ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention

ViCA:仅视觉交叉注意力的高效多模态大语言模型

Wenjie Liu, Hao Wu, Xin Qiu, Xudong Wang, Yingqi Fan, Yihan Zhang, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院、东部技术研究院) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心、慕尼黑大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ViCA架构,通过仅视觉交叉注意力减少视觉令牌计算,在保持98%准确率的同时将视觉计算降至4%,实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27967 2026-05-28 stat.ME cs.AI cs.LG stat.ML 73%

Multi-Teacher Knowledge Distillation via Teacher-Informed Mixture Priors

通过教师引导的混合先验进行多教师知识蒸馏

Luyang Fang, Yongkai Chen, Jiazhang Cai, Ping Ma, Wenxuan Zhong

机构 * Department of Statistics, University of Georgia(佐治亚大学统计系) Department of Statistics, Harvard University(哈佛大学统计系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出多教师贝叶斯知识蒸馏(MT-BKD)框架,利用贝叶斯推断和教师引导的先验分布,结合熵加权机制,实现多教师知识的高效融合与不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27646 2026-05-28 cs.LG cs.AI 73%

Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

Hurwitz四元数乘法量化用于KV缓存压缩

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) IBM Research, Cambridge, MA, USA(IBM研究院) University of Toronto, Toronto, Canada(多伦多大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种免校准的Hurwitz四元数乘法量化方法,通过将K/V的4元素块视为四元数并用量化乘积编码,在约5比特下匹配fp16困惑度,实现高达5.05倍KV缓存压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏