» Etiket
inference
44 yayınOpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.
Ölçekleme Yasaları: Kaplan'dan Chinchilla'ya, Aşırı Eğitime
LLM ölçekleme yasalarının Kaplan'dan Chinchilla'ya evrimi ve mühendislerin neden modelleri kasıtlı olarak aşırı eğittiği açıklanıyor.
Speculative Decoding: Yerel LLM'lerde Kullanılmayan Ücretsiz Hız Kazancı
Speculative decoding, yerel LLM çıktısını değiştirmeden 1.5-2.5 kat hızlandırıyor; 2026'da MTP ile modellere doğrudan entegre edildi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLLMrPro: Kendi Donanımınızla Çalışan Açık Kaynak LLM Dengeleyici
LLMrPro, kendi makinelerinizi ve bulut sağlayıcılarını tek OpenAI uyumlu API altında birleştiren açık kaynak, kendi kendine barındırılan LLM dengeleyicisidir.
Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu
Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.
Bun'ın Rust Geçişi AI Altyapısında C#'ın Yükselişini Gösteriyor
Bun'ın Zig'den Rust'a geçişi, üretim AI altyapısında derlenmiş dillerin değerini ortaya koyuyor. TensorSharp benchmark sonuçları C#'ın bu katmandaki potansiyelini gösteriyor.
ZML/LLMD Alfa: CUDA'dan Apple Metal'e Tek LLM Sunucusu
ZML/LLMD alfa; LLaMa, Gemma, Qwen ve Mistral modellerini NVIDIA, AMD, TPU, Intel ve Apple Metal'de tek sunucuyla çalıştırıyor, DFlash ile hızlanma sağlıyor.
24 GiB Dizüstü Bilgisayarda 200K-Token LLM Sunumu
JustFit, 24 GiB dizüstü bilgisayarda 200K-token LLM sunumunu mümkün kılıyor.
NVIDIA Dynamo ile LLM Çıktı Kapasitesini Hızla Yenileyin
NVIDIA Dynamo'daki gölge motoru kurtarma, LLM süreçlerinin hızlı bir şekilde yeniden başlatılmasını sağlıyor.
AMD MI300X ve Nvidia H100 ile 72B LLM için byte-aynı çıkarım
Yeni bir protokol, AMD MI300X ve Nvidia H100 ile 72B LLM için byte-aynı çıkarımlar üretiyor.