SwarmLLM: Tarayıcı Sekmelerinde Eşler Arası LLM Çıkarımı
SwarmLLM, WebRTC ve özel WebGPU motoruyla Qwen 3.8 27B'yi tarayıcı sekmelerinde cihazlar arasında paylaştırarak kurulumsuz LLM çıkarımı sağlıyor.
SwarmLLM, tek bir cihaza sığmayan büyük dil modellerini aynı odadaki birden fazla cihaza (dizüstü, telefon, PC) böler ve her cihazın tarayıcı sekmesinde WebRTC üzerinden çalıştırır. Kurulum ya da hesap gerekmez; cihazlar arasında yalnızca 10 KB'lık aktivasyon vektörleri dolaşır, hiçbir sunucu modelin çıktısını görmez.
Proje, sıfırdan yazılmış ~50 WGSL çekirdeğinden oluşan bir WebGPU motoruyla Qwen 3.8 27B (15 GB Q4_0 ağırlık) gibi modelleri MacBook ve iPhone gibi cihazlar arasında paylaştırabiliyor. NVIDIA GB10'da ölçülen 9.0 tok/s düz kod çözme ve spekülatif kod çözmeyle 16 tok/s, aynı dosya ve GPU'da native llama.cpp'nin 8.0 tok/s'lik performansını geride bırakıyor; tüm optimizasyonlar altın testlerle bit-eşitliğe kilitlenmiş durumda.
Engineer'lar için önemli olan nokta: exo, Petals, distributed-llama ve llama.cpp rpc-server gibi dağıtık çıkarım çözümlerinin aksine SwarmLLM hiçbir yerel paket, ikili dosya ya da açık port gerektirmiyor — sadece WebGPU destekli bir tarayıcı. Bellek bant genişliği sınırına dayalı kod çözme mimarisi ve spekülatif kod çözme ile aynı akışı üretme garantisi, tarayıcı tabanlı çıkarımın native performansa rakip olabileceğini gösteriyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz