» Etiket
llm-inference
2 yayınLLM Çıkarımında Gerçek Maliyet: Bellek Bant Genişliği
LLM sunumunda darboğaz FLOP değil, KV cache'in bellekten taşınma maliyeti. Prefill/decode ayrımı, batch boyutu ve context yönetimi neden asıl maliyet kalemi.
GLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com