Headroom: Yerel AI için GPU bant genişliği tavanını tarayıcıda ölç
Headroom, WebGPU ile tarayıcıda GPU bellek bant genişliği tavanını ölçüp yerel AI tok/s performansını ve sürücü hatalarını gösteren açık araç.
Headroom, WebGPU üzerinden çalışan ve bir cihazın yerel yapay zeka çıkarımı için gerçek bellek bant genişliği tavanını ölçen açık bir tarayıcı aracı. Bu tavan, saniyedeki token sayısını (tok/s) doğrudan belirleyen kritik metrik. Araç, gerçek model indirmek yerine sentetik ağırlıklar kullanıyor; sadece ~0.4 MB'lık tensor meta verisi çekiliyor, hesap veya telemetri gerektirmiyor ve tüm ölçüm tarayıcıda kalıyor.
Headroom ayrıca bazı tarayıcı içi LLM'lerin sessizce hatalı çıktı üretmesine neden olan bilinen bir WebGPU subgroup sürücü hatasını da tespit ediyor. Ölçümler, CPU tarafında çalışan bir FP64 referans kapısıyla doğrulanıyor ve Gemma sınıfı modeller ile 8B q4 gibi yapılandırmalar için projekte edilen tok/s tavanları sunuluyor.
Gerçek çıkarım motorlarının bu teorik tavanın yalnızca %30-50'sine ulaştığı gösteriliyor; aradaki fark motor yükünden kaynaklanıyor. Araç M1 ve RTX 5070 üzerinde doğrulanmış olup masaüstü Chrome/Edge ve güncel Android Chrome'da WebGPU desteği gerektiriyor. Yerel LLM performansını optimize eden geliştiriciler için donanım limitlerini net biçimde gösteren pratik bir referans noktası sağlıyor.