« Tüm yayınlar

TurboFieldfare: Gemma 4 26B MoE modeli Mac'te 2 GB RAM'le çalışıyor

TurboFieldfare, Gemma 4 26B MoE modelini uzman akışı ile 8 GB RAM'li Apple Silicon Mac'lerde 2 GB bellekle çalıştıran açık kaynaklı Swift/Metal motoru.

TurboFieldfare, Google'ın 26 milyar parametreli Gemma 4 26B-A4B modelini herhangi bir Apple Silicon Mac'te, hatta 8 GB RAM'li bir M2 MacBook Air'de bile çalıştırabilen açık kaynaklı bir Swift ve Metal runtime'ı. Proje, MLX veya llama.cpp'ye bir sarmalayıcı değil; modele özel yazılmış bir motor ve modelin karışık uzman (MoE) mimarisinden yararlanıyor. 14.3 GB'lık ağırlıkların tamamını belleğe yüklemek yerine yalnızca paylaşılan 1.35 GB'lık çekirdeği ve FP16 KV önbelleğini bellekte tutuyor, her token için gereken uzmanları SSD'den akış olarak çekiyor. Bu sayede toplam bellek kullanımı yaklaşık 2 GB'a iniyor, token başına yalnızca ~3.88 milyar parametre aktif hale geliyor.

Proje; yerel bir Mac uygulaması, komut satırı arayüzü ve OpenAI uyumlu bir loopback sunucusu sunuyor. Kurulum aracı, dosya sistemine tam bir kopya yazmadan Hugging Face'ten gelen bayt aralıklarını doğrudan .gturbo formatına paketliyor. Ölçülen performans, 8 GB'lık M2 MacBook Air'de saniyede 5-6 token, 24 GB'lık M5 Pro'da ise 31-35 token seviyesinde. Mühendisler için bu yaklaşım, büyük MoE modellerinin bellek kısıtlı donanımlarda nasıl pratik hale getirilebileceğine dair somut bir mühendislik örneği sunuyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz