FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training
FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练
机构 * Puch AI ; Singapore Institute of Technology(新加坡理工大学) ; Nanyang Technological University(南洋理工大学) ; NVIDIA(英伟达) ; IIIT-Delhi(德里印度理工学院)
AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。