» Etiket
llm-inference
3 yayınLLM Çıkarımında Gerçek Maliyet: Bellek Bant Genişliği
LLM sunumunda darboğaz FLOP değil, KV cache'in bellekten taşınma maliyeti. Prefill/decode ayrımı, batch boyutu ve context yönetimi neden asıl maliyet kalemi.
GLM 5.2 Yerel Kurulum Rehberi: Kuantizasyon ve Donanım Seçimi
753B parametreli MoE modeli GLM 5.2'yi yerelde çalıştırmak için Unsloth dinamik kuantizasyonları, RAM gereksinimleri ve donanım seçenekleri karşılaştırıldı.
Trendyol'un ajanı LLM sunum ayarlarını 4 kat hızlandırdı
Trendyol Tech, autooptimizer adlı bir AI ajanıyla vLLM sunum ayarlarını insan müdahalesi olmadan optimize ederek Gemma 4 26B'de 4 kat performans artışı elde etti.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com