» Etiket
inference
10 yayınNVIDIA Dynamo ile LLM Çıktı Kapasitesini Hızla Yenileyin
NVIDIA Dynamo'daki gölge motoru kurtarma, LLM süreçlerinin hızlı bir şekilde yeniden başlatılmasını sağlıyor.
AMD MI300X ve Nvidia H100 ile 72B LLM için byte-aynı çıkarım
Yeni bir protokol, AMD MI300X ve Nvidia H100 ile 72B LLM için byte-aynı çıkarımlar üretiyor.
Darkbloom: Mac'lerde AI Çıkarım ve Güvenlik Denetimi
Darkbloom, Mac'lerde AI çıkarımını sağlayan bir ağdır. Güvenlik denetimi sonuçları ve bulgular burada.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comNvidia ve Cerebras: Müşterilerin Asla Göremeyeceği Performans Satışı
Nvidia ve Cerebras, Hot Chips konferansında performanslarını duyurdu. Ancak bu rakamlar, gerçek kullanımda karşılaşılmayabilir.
vLLM: Yüksek Verimli LLM Çıktı Sistemi Bileşenleri
vLLM'nin yüksek verimli LLM çıktı sistemi bileşenleri ve özellikleri hakkında bilgi edinin.
Hızlı, Etkileşimli Uzun-Kontekst Çıkarımı için AI Modeli Tasarımı
Uzun-kontekst AI modellerinin dikkat mekanizması ve çıkarım verimliliği üzerine pratik kılavuzlar.
vLLM'nin sunum yığını C++20'ye taşındı: 66 MiB ikili dosya
vLLM'nin C++20'ye taşınmasıyla Python bağımlılığı olmadan 66 MiB boyutunda bir ikili dosya elde edildi. Yüksek eşzamanlılıkta benzer hızlar sunuyor.
AMD, Taalas'ı satın alarak AI çip performansını artırmayı hedefliyor
AMD, Taalas'ı satın alarak AI çip performansını artırmayı ve Nvidia'ya karşı rekabet etmeyi hedefliyor.
Patlayıcı Gelen Talepler LLM Çıktı Sürelerini Hızlandırıyor
Patlayıcı yüklerin LLM çıktılarında beklenmedik hız artışı sağladığı keşfedildi.
Cerebras CS-4 Rack Sistemleri: AI Performansında Yeni Bir Dönem
Cerebras, yeni WSE-3T ve CS-4 rack sistemleri ile AI performansını artırmayı hedefliyor.