» Etiket
inference
6 yayınllama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.
Netflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor
Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLMrPro: Kendi Donanımınızla Çalışan Açık Kaynak LLM Dengeleyici
LLMrPro, kendi makinelerinizi ve bulut sağlayıcılarını tek OpenAI uyumlu API altında birleştiren açık kaynak, kendi kendine barındırılan LLM dengeleyicisidir.
Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
LLM Çıkarımına Giriş: Süreç ve Önemi
LLM çıkarım sürecini ve mühendislik açısından önemini keşfedin. Performans ve model yapısı hakkında detaylı bilgiler edinin.