» Etiket
inference
27 yayınÖlçekleme Yasaları: Kaplan'dan Chinchilla'ya, Aşırı Eğitime
LLM ölçekleme yasalarının Kaplan'dan Chinchilla'ya evrimi ve mühendislerin neden modelleri kasıtlı olarak aşırı eğittiği açıklanıyor.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
LLMrPro: Kendi Donanımınızla Çalışan Açık Kaynak LLM Dengeleyici
LLMrPro, kendi makinelerinizi ve bulut sağlayıcılarını tek OpenAI uyumlu API altında birleştiren açık kaynak, kendi kendine barındırılan LLM dengeleyicisidir.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNetflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
Bun'ın Rust Geçişi AI Altyapısında C#'ın Yükselişini Gösteriyor
Bun'ın Zig'den Rust'a geçişi, üretim AI altyapısında derlenmiş dillerin değerini ortaya koyuyor. TensorSharp benchmark sonuçları C#'ın bu katmandaki potansiyelini gösteriyor.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.
Birleşik Bellek: Mini PC'ler Dev GPU'ların Yapamadığını Nasıl Yapar
AMD Strix Halo gibi birleşik bellekli mini PC'ler, 70B parametreli modelleri RTX 5090'ın bile sığdıramadığı şekilde çalıştırabiliyor. Kapasite ve bant genişliği dengesini inceliyoruz.
OpenAI ve Broadcom'dan LLM'e özel çıkarım çipi Jalapeño
OpenAI ve Broadcom, dokuz ayda geliştirilen ilk özel LLM çıkarım çipi Jalapeño'yu tanıttı; gigawatt ölçekli veri merkezlerinde 2026'da devreye girecek.
WISP: Tüketici Donanımında 744B+ Parametreli MoE Modelleri İçin CUDA Motoru
WISP, 744B+ parametreli MoE modellerini tüketici donanımında akış halinde çalıştırmak için geliştirilmiş bir CUDA motorudur.
Ninfer: Tek GPU ile yüksek performanslı çıkarım
NInfer, RTX 5090 üzerinde yüksek performanslı çıkarım için C++/CUDA motoru sunuyor.