« Tüm yayınlar

2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı

Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.

Moonshot'un dün yayımladığı açık ağırlıklı Kimi K3 modeli, 2.8 trilyon parametreyle şimdiye kadarki en büyük açık kaynaklı büyük dil modellerinden biri. Bir geliştirici, hiç GPU içermeyen bir mini PC'de (Ryzen AI 9 HX 370, 128GB RAM) modeli çalıştırıp doğru yanıt aldığını duyurdu. 1.56TB'lık, 96 parçaya bölünmüş checkpoint hiçbir standart makinenin RAM'ine sığmıyor, ancak modelin MoE (mixture-of-experts) mimarisi sayesinde her token için 896 uzmandan sadece birkaçı devreye giriyor. Yoğun kısımlar (attention, paylaşılan uzmanlar) niceliklenmiş halde RAM'de tutulurken, yönlendirilen uzmanlar diskten talep üzerine akıtılıyor ve sık kullanılanlar LRU önbellekte kalıcı hale getiriliyor.

Moonshot, K3'ün uzmanlarını doğrudan MXFP4 formatında yayımladığı için herhangi bir dönüştürme adımına gerek kalmadı; motor, yayımlanan safetensors dosyalarını doğrudan okuyabiliyor. Doğruluk üç farklı yöntemle test edildi: Moonshot'un referans koduyla bit-bit karşılaştırma, tam checkpoint üzerinde yapısal test ve gerçek bir soru-cevap denemesi ("Fransa'nın başkenti neresi?" sorusuna doğru yanıt "Paris").

Performans henüz optimize edilmemiş durumda: model yüklenmesi 10 dakika sürüyor, 40 token üretimi yaklaşık 45 dakika alıyor. Aynı motorda çalışan başka bir model (GLM-5.2, 744B) sekiz optimizasyon turundan sonra saniyede 0.29'dan 1.02 kelimeye çıkmıştı; K3 için henüz böyle bir ayar yapılmadı. Yine de bu deneme, dev MoE modellerinin tüketici donanımında, hatta GPU olmadan bile çalışabileceğini gösteriyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz