8 Dolarlık Mikrodenetleyicide 28,9 Milyon Parametreli LLM
ESP32-S3 mikrodenetleyicide, Google'ın Per-Layer Embeddings tekniğiyle 28,9 milyon parametreli bir LLM tamamen çevrimdışı çalıştırıldı.
Bir geliştirici, ESP32-S3 mikrodenetleyicisinde (yaklaşık 8 dolar) çalışan 28,9 milyon parametreli bir dil modeli geliştirdi. Model tamamen cihaz üzerinde çalışıyor, internet bağlantısı gerektirmiyor ve saniyede yaklaşık 9 token üretiyor. Bu, aynı sınıf çipte daha önce çalıştırılan 260 bin parametrelik modele göre yaklaşık yüz kat daha büyük bir sıçrama.
Bunu mümkün kılan teknik, Google'ın Gemma modellerinden gelen Katman Başına Gömme (Per-Layer Embeddings) fikri. Modelin 25 milyon parametresini barındıran gömme tablosu, hızlı SRAM yerine yavaş ama bol flash bellekte tutuluyor; her token için sadece birkaç satır (~450 bayt) okunuyor. Asıl hesaplamayı yapan küçük çekirdek ise hızlı bellekte kalıyor, böylece 512KB SRAM sınırına takılmadan çok daha büyük bir model çalıştırılabiliyor.
Model, TinyStories veri setiyle eğitildiği için soru yanıtlamıyor, talimat izlemiyor ya da kod yazmıyor; sadece kısa ve tutarlı hikayeler üretiyor. Buradaki asıl önemli nokta modelin yetenekleri değil, büyük bir modelin bu kadar kısıtlı bir donanıma sığdırılabilmesini sağlayan mimari çözüm. Firmware, eğitim kodu ve ölçüm sonuçları açık kaynak olarak paylaşılmış durumda.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz