« Tüm yayınlar

397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı

Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.

Krasis adlı MoE odaklı çalışma zamanı, 397 milyar parametreli Ornith-1.0 modelini tek bir NVIDIA RTX PRO 6000 Blackwell 96GB GPU üzerinde interaktif olarak çalıştırmayı başardı. Model VRAM'e sığmadığı için Krasis, uzman (expert) katmanlarını CPU RAM'inde tutuyor ve yönlendirilen uzmanların yaklaşık %43'ünü dinamik olarak VRAM'de tutarak akış halinde besliyor.

Çalışma INT4 nicemlenmiş uzmanlar, HQQ4 dikkat mekanizması ve 4-bit KV önbelleği kullanıyor; tepe işlem belleği yaklaşık 202GB'a ulaşıyor, dolayısıyla tüketici sınıfı DDR5 anakartlarla 256GB RAM ile çalışması mümkün. Ölçülen performans, 39.920 token'da 2.354 tok/s prefill ve 250 token boyunca sürdürülen 20,4 tok/s çözümleme hızını gösteriyor. Krasis'in Adaptif Soğuk Kütle Budama (Adaptive Cold Mass Pruning) özelliği, ortalama yalnızca %1,8 yönlendirilmiş olasılık kütlesini atlayarak çözümleme hızını %9,1 artırabiliyor.

Aynı çalışma zamanı, model tamamen sistem RAM'ine sığdığında daha küçük MoE modellerini çok daha hızlı çalıştırabiliyor (5090'da 35B sınıfı modellerde ~117 tok/s) ve Ornith-397B, sabırlı kullanıcılar için tek bir RTX 5090 32GB'de bile ~7,9 tok/s ile çalışabiliyor. Bu sonuç, büyük MoE modellerinin tüketici/iş istasyonu donanımında yerel olarak çalıştırılabilirliği açısından önemli bir kanıt niteliğinde.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz