2.8 Trilyon Parametreli Kimi K3, 64GB M1 Mac'te Çalıştırıldı
Deltafin, 2.8 trilyon parametreli Kimi K3 MoE modelini 64GB'lık M1 Mac'te, tam kurulum veya akış modu ile çalıştırıyor.
Deltafin, 2.8 trilyon parametreli bir Mixture-of-Experts modeli olan Kimi K3'ü tek bir Apple Silicon Mac'te, 64 GB RAM ile çalıştıran bir araştırma projesi. Modelin toplam ağırlıkları yaklaşık 1.56 TB olup makinenin hem RAM'ini hem de tipik disk bütçesini aşıyor; ancak MoE seyrekliği sayesinde her token, 92 katman boyunca 896 uzmandan yalnızca 16'sına dokunuyor.
Proje iki kurulum modu sunuyor. Tam kurulum, yaklaşık 1.7 TB'lık tüm uzman verisini yerel olarak indiriyor; bu 5-10 saat sürüyor ama sonrasında çıkarım sırasında ağ bağımlılığı olmadan token başına sabit 60-76 saniye hız sağlıyor. Akış modu ise yalnızca ~215 GB disk ve yaklaşık 30 dakika kurulum gerektiriyor, ancak önbellekte olmayan uzmanları çıkarım anında HTTP range istekleriyle çekiyor; bu da önbelleğe alınmamış her şey için token başına 3+ dakikaya kadar gecikmeye yol açıyor. Kullanıcılar akış moduyla başlayıp yeniden yapılandırma yapmadan tam yerel depolamaya geçebiliyor.
Deltafin, CUDA'ya özgü kernel'lerin yerine geçen saf PyTorch bir katman aracılığıyla Moonshot'ın değiştirilmemiş modelleme kodunu kullanıyor, clang ile derlenmiş birleştirilmiş bir MXFP4 GEMV kernel'i ekliyor ve OpenAI uyumlu bir API sunucusu sağlıyor. Yapılandırma büyük ölçüde otomatik (GPU tespiti, int8 omurga niceleme, spekülatif çözümleme), ancak proje bunun üretim iş akışları için değil, deneysel kullanım için tasarlanmış yavaş, yalnızca greedy çıkarım olduğunu açıkça belirtiyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz