arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-06-04 至 2026-06-04 共收录 2
2606.04238 2026-06-04 cs.LG cs.AI

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

Recover-LoRA 用于激进量化:通过低秩适配与合成数据知识蒸馏恢复2比特语言模型的精度

Devleena Das, Rajeev Patwari, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 针对2比特激进量化导致的大语言模型精度严重下降问题,提出Recover-LoRA方法,结合选择性混合精度策略(仅MLP的gate和up层量化为2比特)和基于合成数据蒸馏的低秩适配训练,在Qwen3-4B上以1万合成样本在12个基准中恢复9个基准80-95%的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10236 2026-06-04 cs.DC cs.AR cs.LG

Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap

基于DMA的细粒度计算通信重叠的设计空间探索

Shagnik Pal, Shaizeen Aga, Suchita Pati, Mahzabeen Islam, Lizy K. John

机构 * Advanced Micro Devices Inc.(先进微器件公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出细粒度计算通信重叠方法FiCCO,通过深入分片粒度以下、利用DMA引擎卸载通信,实现更广泛网络拓扑下的性能优化,最高获得1.6倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏