» Etiket
inference
12 yayınCPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
NVIDIA ModelExpress: P2P RDMA ile Model Başlatma Saniyelere İniyor
NVIDIA ModelExpress, P2P GPU-to-GPU RDMA transferleriyle LLM ağırlık yüklemesini hızlandırıyor; model başlatma süresi dakikalardan saniyelere iniyor.
2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı
Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comOpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım
OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.
Ölçekleme Yasaları: Kaplan'dan Chinchilla'ya, Aşırı Eğitime
LLM ölçekleme yasalarının Kaplan'dan Chinchilla'ya evrimi ve mühendislerin neden modelleri kasıtlı olarak aşırı eğittiği açıklanıyor.
WISP: Tüketici Donanımında 744B+ Parametreli MoE Modelleri İçin CUDA Motoru
WISP, 744B+ parametreli MoE modellerini tüketici donanımında akış halinde çalıştırmak için geliştirilmiş bir CUDA motorudur.
Ninfer: Tek GPU ile yüksek performanslı çıkarım
NInfer, RTX 5090 üzerinde yüksek performanslı çıkarım için C++/CUDA motoru sunuyor.
Hızlı, Etkileşimli Uzun-Kontekst Çıkarımı için AI Modeli Tasarımı
Uzun-kontekst AI modellerinin dikkat mekanizması ve çıkarım verimliliği üzerine pratik kılavuzlar.
Patlayıcı Gelen Talepler LLM Çıktı Sürelerini Hızlandırıyor
Patlayıcı yüklerin LLM çıktılarında beklenmedik hız artışı sağladığı keşfedildi.
Vektör İşlemcilerde İnferans için Çatı Hattı Sparse Tensör Kontraksiyonları
Ventaglio, vektör işlemcilerde seyrek tensör kontraksiyonlarını hızlandırarak performansı artırıyor.