arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1048 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1048 篇

2407.21311 2026-08-05 cs.CV cs.AI cs.LG 版本更新 62%

Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment

基于自监督视觉Transformer与协同跨域对齐的高效无监督域适应

Ali Abedi, Q. M. Jonathan Wu, Ning Zhang, Farhad Pourpanah

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出EUDA框架,以冻结的DINOv2为特征提取器,结合SDAL损失,在多数据集上实现高效无监督域适应,可训练参数减少42%至99.7%,适配资源受限环境。

Comments 22 pages, 4 figures

Journal ref Abedi, A., Wu, Q.M.J., Zhang, N. et al. Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment. Int. J. Mach. Learn. & Cyber. 17, 423 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07050 2026-08-04 cs.CL cs.LG 版本更新 62%

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

多教师在线策略蒸馏中的行为杠杆不平衡

Jiabin Shen, Guang Chen, Chengjun Mao

机构 * AntGroup(蚂蚁集团)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多教师在线策略蒸馏中行为杠杆不平衡问题,提出Soft Clamp方法,通过校准令牌级散度,减少模型过度调用工具情况,在保持决策准确率的同时,降低工具调用循环和重复调用,提升多教师OPD效果。

Comments 33 pages, 5 figures. Code and aggregate artifacts: https://github.com/shen-jiabin/topk-support-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21848 2026-08-04 cs.CL cs.AI 版本更新 62%

Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

无键注意力:面向高效Transformer的值空间路由与仅值缓存

Xin Gao, Xingming Xu

机构 * York University(约克大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出无键注意力机制,通过消除键投影并仅使用查询和值,实现50%的KV缓存减少,同时匹配或超越标准注意力的解码吞吐量,并在多个模型上达到相当或更优的困惑度与下游任务性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08696 2026-08-04 cs.CL cs.LG 版本更新 62%

Structured Recurrent Mixers for Massively Parallelized Sequence Generation

结构化递归混合器用于大规模并行序列生成

Benjamin L. Badger

机构 * IBM

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种结构化递归混合器架构,能够在训练时实现序列并行表示与推理时的递归表示之间的代数转换,从而在不依赖专用内核或设备特定内存管理的情况下提高训练效率、输入信息容量和推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06741 2026-08-04 cs.LG cs.AI cs.CV 版本更新 62%

Heterogeneous Decentralized Diffusion Models

异构去中心化扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * bagel.com(Bagel公司)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种异构去中心化训练框架,通过支持不同专家使用不同目标(DDPM和Flow Matching)并统一推理、预训练检查点转换以及高效架构,大幅降低计算和数据需求,使单GPU(24-48GB VRAM)即可参与训练。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19321 2026-07-30 cs.AI cs.CR cs.LG 版本更新 62%

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

研究竞技场:评估自动化人工智能研发中的破坏行为与监控

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对自动化人工智能研发,用研究竞技场框架评估人工智能控制,通过四项长期任务及两类隐藏附带任务,评估前沿代理破坏与监控能力,发现训练数据中破坏行为难捕捉,发布框架用于评估自动化人工智能研发中的破坏与控制。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18955 2026-07-28 cs.LG cs.CL 版本更新 62%

H$^2$SD: Hybrid Hindsight Self-Distillation

H$^2$SD:混合事后自蒸馏

Qiye Cai, Yichuan Ma, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Linyang Li, Xiaocheng Feng, Bing Qin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对强化学习中奖励监督问题,提出 H$^2$SD 混合事后自蒸馏框架。成功轨迹用教师概率调更新幅度,失败轨迹基于参考提示调整教师并最小化反向 KL 散度,实验表明该框架优于基线,能稳定优化且效率良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02929 2026-07-28 cs.IR cs.AI cs.LG 版本更新 62%

Realizing Scaling Laws in Recommender Systems: A Foundation-Expert Paradigm for Hyperscale Model Deployment

在推荐系统中实现扩展定律:超大规模模型部署的基础-专家范式

Dai Li, Kevin Course, Wei Li, Hongwei Li, Jie Hua, Yiqi Chen, Zhao Zhu, Rui Jian, Xuan Cao, Bi Xue, Yu Shi, Jing Qian, Kai Ren, Matt Ma, Qunshu Zhang, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对推荐系统中跨多界面部署基础模型的挑战,提出基础-专家范式,中央FM生成目标感知嵌入供特定界面专家模型使用,迁移率超现有方法,自2025年在Meta部署后实现线上指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15456 2026-07-27 cs.LG cs.CL 版本更新 62%

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

循环潜在注意力:用于循环变换器的跨循环键值压缩

James O' Neill, Fergal Reid

机构 * Fin AI Research(金融人工智能研究)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究针对循环变换器解码时键值缓存占用大的问题,提出循环潜在注意力(LLA)编解码器,通过存储紧凑潜在表示按需重建键值向量,经奇异值分解初始化和蒸馏细化,在缓存压缩上效果显著,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31796 2026-07-24 cs.CL cs.AI 版本更新 62%

CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

CHERRY: 具有循环表示收益的压缩层次专家

Dohyeon Kwon, Youngjin Park

机构 * TeamSparta Inc.(TeamSparta公司)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。

Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22216 2026-07-24 cs.CL cs.LG 版本更新 62%

Gumbel Distillation for Parallel Text Generation

Gumbel Distillation用于并行文本生成

Chi Zhang, Xixi Hu, Bo Liu, Qiang Liu

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Gumbel Distillation技术,通过Gumbel-Max技巧使并行解码器有效学习token序列的联合分布,提升生成质量,在LM1B和OpenWebText数据集上取得显著改进。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05774 2026-07-24 cs.LG cs.AI math.PR 版本更新 62%

Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance

变分推测解码:从令牌似然到序列接受的草稿训练再思考

Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出变分推测解码(VSD),将草稿训练视为对潜在提议(草稿路径)的变分推断,通过最大化目标模型接受的边际概率来优化,结合路径级效用和期望最大化过程,显著提升解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20956 2026-07-21 cs.CV cs.AI cs.LG 版本更新 62%

BUSTR: Descriptor-Aware Vision-Language Learning for Breast Ultrasound Report Generation

BUSTR:用于乳腺超声报告生成的描述符感知视觉语言学习

Rawa Mohammed, Mina Attin, Laxmi Gewali, Bryar Shareef

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对公共BUS数据集缺乏配对报告限制模型发展的问题,提出BUSTR框架,利用结构化病变信息,通过构建描述符派生报告、训练多头编码器及双重目标指导训练,提升了乳腺超声报告生成的相似性和描述符恢复能力。

Comments 17 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26556 2026-07-20 cs.CL cs.AI 版本更新 62%

When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

当困惑度谎言:面向生成的混合序列模型蒸馏

Juan Gabriel Kostelec, Qinghai Guo

机构 * Huawei Zurich Research Center(华为苏黎世研究中心) ACS Lab, Huawei Technologies(华为技术有限公司ACS实验室)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Hybrid-KDA架构与GenDistill蒸馏流程,通过生成导向评估揭示传统困惑度评估的局限性,并展示改进后的模型在知识基准上的高准确率与内存效率提升。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15927 2026-07-20 cs.LG cs.AI 版本更新 62%

DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone

DiffuMamba:基于Mamba架构的高吞吐量扩散语言模型

Vaibhav Singh, Oleksiy Ostapenko, Pierre-André Noël, Eugene Belilovsky, Torsten Scholak

机构 * ServiceNow Research, Montreal, Canada(ServiceNow研究机构,加拿大蒙特利尔) Concordia University(Concordia大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 DiffuMamba基于Mamba架构,通过结合扩散目标与线性序列建模,实现了高吞吐量的扩散语言模型,在长序列任务中表现出色。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12466 2026-07-16 cs.CV cs.AI cs.LG 版本更新 62%

Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

Inverse-LLaVA:通过文本到视觉映射重新思考多模态对齐

Xuhui Zhan, Tyler Derr

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究重新审视多模态学习中传统映射方向,提出Inverse-LLaVA架构,通过文本到视觉映射反转方向。该架构无需对齐预训练,在多模态基准测试中展现强大学习效率,为多模态架构设计开辟新方向,解耦表示结构与监督方式。

Comments 19pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27321 2026-07-15 cs.LG cs.AI 版本更新 62%

Beyond the Hard Budget: Sparsity Regularizers for More Interpretable Top-k Sparse Autoencoders

超越硬预算:用于更可解释的Top-k稀疏自编码器的稀疏正则化器

Nathanaël Jacquier, Maria Vakalopoulou, Mahdi S. Hosseini

机构 * Université Paris-Saclay, CentraleSupélec, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,法国) Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, QC, Canada(计算机科学与软件工程系,康科迪亚大学,加拿大) Mila–Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所,加拿大) Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,路易·德·鲁斯医院,国家医学研究院,PRISM机构,癌症数据科学单位,法国) Université Paris-Saclay, CentraleSupélec, MICS Laboratory, France(巴黎-萨克雷大学,中央圣艾克苏佩里大学,MICS实验室,法国)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对Top-k稀疏自编码器固定预算k和过拟合问题,提出两种稀疏正则化器(ℓ1惩罚和ℓ1/ℓ2比例惩罚),在不损失重构质量的前提下提高单语义性,并增强对推理时k选择的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06763 2026-07-14 cs.LG cs.CL 版本更新 62%

Trees from Marginals: Autoregressive drafting with factorized priors

基于边际的树:具有因式先验的自回归草稿生成

Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究自回归语言模型中推测性解码的局限性,提出用Weaver适配器从因式草稿生成器边际构建提议树,恢复条件依赖,还推导算法并实现内核,结合模型与系统贡献,相比自回归解码加速4.37倍,性能超DFlash基线24.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00620 2026-07-14 cs.LG cs.AI 版本更新 62%

Rethinking Zero-Shot Time Series Classification: From Task-specific Classifiers to In-Context Inference

重新思考零样本时间序列分类:从特定任务分类器到上下文推理

Juntao Fang, Shifeng Xie, Shengbin Nie, Yuhui Ling, Yuming Liu, Zijian Li, Keli Zhang, Lujia Pan, Themis Palpanas, Ruichu Cai

机构 * Guangdong University of Technology, Guangzhou, China(广东工业大学) Paris Descartes University, Paris, France(巴黎笛卡尔大学) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学) Huawei Noah’s Ark Lab, Paris, France(华为诺亚实验室) Huawei Noah’s Ark Lab, Shenzhen, China(华为诺亚实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对时间序列基础模型零样本分类中存在的问题,提出TIC-FM上下文学习框架,将训练集作上下文,单次前向传播预测标签,无需参数更新,经实验验证其在多数据集上表现良好,实现无训练迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13563 2026-07-09 cs.LG cs.AI 版本更新 62%

ButterflyMoE: Compression-Scalable Ternary Experts via Structured Butterfly Orbits

ButterflyMoE: 通过结构化的蝴蝶轨道实现子线性三次专家

Aryan Karmore

机构 * Indian Institute of Information Technology, Nagpur(印度纳格浦信息科技学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 ButterflyMoE通过结构化的蝴蝶轨道实现子线性三次专家,有效降低内存消耗并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 62%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04805 2026-07-07 cs.LG cs.AI 版本更新 62%

PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference

PuzzleMoE:通过稀疏专家合并和位打包推理对大型专家混合模型进行高效压缩

Yushu Zhao, Zheng Wang, Minjia Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对专家混合模型内存开销大难题,提出PuzzleMoE方法。通过识别权重冗余与专业化进行稀疏专家合并,用双掩码捕获参数,引入位打包编码避免存储开销,实现高效推理,大幅压缩模型且保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15438 2026-06-25 cs.LG cs.AI stat.ML 版本更新 62%

Logit Distance Bounds Representational Similarity

Logit距离界限表征相似性

Beatrix M. G. Nielsen, Emanuele Marconato, Luigi Gresele, Andrea Dittadi, Simon Buchholz

机构 * IT University of Copenhagen, Denmark(丹麦IT大学) University of Trento, Italy(意大利特伦托大学) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究判别模型在分布接近时内部表征是否线性相似,提出基于logit差异的距离度量,证明其能保证线性相似性,并用于蒸馏实验提升学生模型表征相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14001 2026-06-24 cs.CV cs.AI cs.LG 版本更新 62%

MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment

MOCHA: 多模态对象感知的跨架构对齐

Elena Camuffo, Francesco Barbato, Mete Ozay, Simone Milani, Umberto Michieli

机构 * University of Padova(帕多瓦大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MOCHA蒸馏框架,将冻结VLM教师的多模态区域知识迁移至轻量视觉检测器,通过双重损失实现局部对齐与全局关系一致性,在少样本个性化检测中平均提升10.1%。

Comments 18 pages main paper, 10 pages supplementary material

Journal ref Proceedings of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10178 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新 62%

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

从马尔可夫到拉普拉斯:Mamba如何通过上下文学习马尔可夫链

Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

机构 * EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Télécom Paris(巴黎电信学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究Mamba在马尔可夫链上的上下文学习能力,发现单层Mamba能高效学习最优的拉普拉斯平滑估计器,并理论上揭示了卷积在其中的关键作用。

Comments Oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05985 2026-06-23 cs.LG cs.AI cs.NE 版本更新 62%

LAYUP: Asynchronous decentralized gradient descent with LAYer-wise UPdates

LAYUP: 基于逐层更新的异步去中心化梯度下降

Cabrel Teguemne Fokam, Marcel Nieveler, Lukas König, Khaleelulla Khan Nazeer, David Kappel, Anand Subramoney

机构 * Center for Cognitive Interaction Technology, Universität Bielefeld, Germany(认知交互技术中心,比勒菲尔德大学,德国) Bielefeld University(比勒菲尔德大学) Department of Computer Science, Royal Holloway, University of London, United Kingdom(计算机科学系,伦敦大学皇家霍洛威学院,英国)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出异步去中心化SGD方法LayUp,通过逐层更新和随机gossip通信减少参数漂移,理论证明收敛性,实验显示比同步训练快32%,比同类算法快27%。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15707 2026-06-19 cs.MM cs.CL cs.LG 版本更新 62%

Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU

基于音频和IMU的主动式程序性任务对话助手

Rehana Mahfuz, Yinyi Guo, Erik Visser, Phanidhar Chinchili

机构 * Qualcomm Technologies, Inc.(高通技术公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出首个仅使用音频和IMU模态的实时对话助手,通过微调语言模型减少不必要对话并提升问答准确性,在边缘设备上实现无云依赖。

Comments 5 figures. 5 more in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07048 2026-06-10 cs.SD cs.AI cs.LG eess.AS 版本更新 62%

Whisfusion: Parallel ASR Decoding with Masked Diffusion

Whisfusion: 基于掩码扩散的并行ASR解码

Taeyoun Kwon, Junhyuk Ahn, Taegeun Yun, Heeju Jwa, Yoonchae Choi, Siwon Park, Jongchan Kim, Hyungon Ryu, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Whisfusion,在冻结的Whisper音频嵌入上训练专用掩码扩散解码器,通过并行扩散解码实现非自回归ASR,在多种语言基准上超越Whisper-large-v3,速度提升4-5倍。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09967 2026-06-09 cs.LG cs.AI 版本更新 62%

Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning

Muon²:通过自适应二阶矩预条件提升穆隆

Ziyue Liu, Ruijie Zhang, Zhengyang Wang, Yequan Zhao, Yupeng Su, Zi Yang, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣巴巴拉分校) University at Albany, SUNY(阿尔巴尼大学,SUNY)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 Muon²通过引入Adam风格的自适应二阶矩预条件改进了穆隆的效率与质量,提升了极化近似中的收敛速度和实际正交化质量,实验表明其在参数规模达13B的预训练任务中表现更优。

Comments Preprint, subject to update

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25054 2026-06-08 cs.LG cs.AI 版本更新 62%

Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

按需扩展:自适应神经元级混合精度量化感知训练

Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas, Adam Orucu, Aneta Vulgarakis Feljan

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维) University of Cambridge(剑桥大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出神经元级混合精度量化感知训练(NMP-QAT),通过可微代理和直通估计器让每个神经元独立学习离散精度,实现按需扩展位宽,在MLP和表格基础模型上取得更优的压缩-精度权衡。

Comments Accepted at ICML - GlobalSouthML workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏