« Tüm yayınlar

SkewAdam: MoE Durum Belleğini %97 Azaltan Yeni Bir Optimizatör

SkewAdam, MoE eğitiminde durum belleğini %97 azaltarak 6.7B modeli 40GB GPU'ya sığdırıyor.

Yeni bir optimizatör olan SkewAdam, Mixture-of-Experts (MoE) eğitiminde büyük VRAM darboğazını aşmak için tasarlandı. Geleneksel optimizatörler, özellikle AdamW, büyük miktarda bellek kullanırken, SkewAdam, parametre davranışına dayalı olarak katmanlı bir durum tahsisi kullanıyor. Bu sayede, optimizatör durumu belleği %97.4 oranında azaltılarak 1.29 GB'a düşürülüyor ve 6.78B'lik bir MoE'nin tek bir 40GB GPU'da rahatlıkla eğitilmesi sağlanıyor.