» Etiket
ml-infrastructure
3 yayınLLM Çıkarımında Gerçek Maliyet: Bellek Bant Genişliği
LLM sunumunda darboğaz FLOP değil, KV cache'in bellekten taşınma maliyeti. Prefill/decode ayrımı, batch boyutu ve context yönetimi neden asıl maliyet kalemi.
Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com