56M parametreli LLM, ESP-NOW ile 3 ESP32-S3 kartına dağıtıldı
56M parametreli LLM, ESP-NOW üzerinden üç ESP32-S3 kartına dağıtılarak çalıştırıldı; Split-PLE ve KV cache ile tutarlılık artırıldı.
Bir geliştirici, Google Gemma mimarisinden esinlenen Per-Layer Embeddings (PLE) tekniğiyle eğitilmiş 56 milyon parametrelik bir dil modelini üç ESP32-S3 N16R8 kartı arasında ESP-NOW kablosuz protokolü üzerinden dağıtık şekilde çalıştırdı. WikiText-103 üzerinde eğitilen model 4-bit'e kuantize edilip, 50.3M parametrelik PLE tablosu flash sınırlamaları nedeniyle iki kart arasında bölündü (Split-PLE); üçüncü kart tokenizasyon, çıkış katmanı ve web arayüzünü yönetiyor.
Projenin en kritik iyileştirmesi, Board B üzerinde PSRAM'de tutulan bir KV cache (256 pozisyon için 1.5 MB) eklenmesi oldu. Öncesinde her token seq_len=1 ile işlendiğinden model geçmiş bağlamı göremiyordu; cache ve doğru RoPE pozisyon indeksleriyle transformer artık tasarlandığı gibi tam üretilen diziye dikkat edebiliyor, bu da tutarlılıkta belirgin bir sıçrama sağladı.
Kartlar arası iletişim, 250 bayt paket boyutu sınırına sahip özel bir ESP-NOW protokolü ile 1-5ms gecikmeyle yürütülüyor; kullanıcı isteği tarayıcıdan SSE akışıyla gerçek zamanlı olarak görüntülüyor. Gömülü sistem mühendisleri için bu çalışma, ağır kuantizasyon, bellek bölme ve düşük gecikmeli kartlar arası mesajlaşmayla mikrodenetleyici kümelerinde LLM çıkarımının pratik sınırlarını gösteriyor.