» Etiket
inference
3 yayınCPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
OpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.
Vektör İşlemcilerde İnferans için Çatı Hattı Sparse Tensör Kontraksiyonları
Ventaglio, vektör işlemcilerde seyrek tensör kontraksiyonlarını hızlandırarak performansı artırıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com