» Etiket
optimization
41 yayınCPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
Julia'ya UnifiedIR: Derleyici Boru Hattı İçin Tek IR
Julia derleyicisi, ayrıştırma, lowering ve optimizasyonu tek IR yapısı UnifiedIR altında birleştiriyor; paylaşımlı kind kaydı ve kaynak izleme dahil.
Colibri: 744B parametreli GLM-5.2'yi 25GB RAM ile çalıştırma
Colibri, tek dosyalık C motoruyla GLM-5.2'nin 744B parametreli MoE modelini GPU'suz, 25GB RAM'lik makinede çalıştırıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFable 5 vs GPT-5.6 Sol: NP-Zor Problemde /goal İşe Yarıyor mu?
Claude Fable 5 ve GPT-5.6 Sol, NP-zor bir fiber ağ optimizasyon probleminde /goal özelliğiyle test edildi; sonuçlar beklenmedik çıktı.
FlowOptimizer: Akış Modelleriyle Öğrenen Optimizasyon
MIT ve Boston University'den araştırmacılar, popülasyon tabanlı akış modelleriyle optimizasyon adımlarını öğrenen ve klasik yöntemleri kat kat geride bırakan FlowOptimizer'ı tanıttı.
OpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.
Tarayıcıda Video Render Süresini %80 Nasıl Kısalttık
Bir video render motorundaki dört gizli performans hatası nasıl bulundu ve düzeltildi: kare süresi %80 azaldı, gizli bir opaklık hatası da ortaya çıktı.
Rust'ta 6 kat hızlı toplu ikili arama: dallanma tahmini optimizasyonu
scikit-learn'ün ikili arama kodu Rust'ta dallanma tahmini optimizasyonuyla 6 kat hızlandırıldı; CPU mekanik sempatisi üzerine teknik inceleme.
PyTorch'ta Profil Oluşturma (Bölüm 3): Dikkat Profilinizdir
PyTorch'ta dikkat mekanizmasını profil oluşturma ile ele alıyoruz. Performans iyileştirmeleri için in-place operasyonlar kullanıyoruz.
NEON ile a[mask] = f(a[mask]): Hızlı ve Verimli Çözüm
NEON üzerinde koşula dayalı işlemleri optimize eden yeni yöntemler. Geliştiriciler için önemli bilgiler.