» Etiket
inference
44 yayınvLLM'nin sunum yığını C++20'ye taşındı: 66 MiB ikili dosya
vLLM'nin C++20'ye taşınmasıyla Python bağımlılığı olmadan 66 MiB boyutunda bir ikili dosya elde edildi. Yüksek eşzamanlılıkta benzer hızlar sunuyor.
Tam kumaş VHDL LLM çıkarım motoru: Qwen3.5 sınıfı
Tam kumaş VHDL LLM çıkarım motoru, Qwen3.5 sınıfı transformer çıkarımını FPGA'da gerçekleştiriyor.
AMD, Taalas'ı satın alarak AI çip performansını artırmayı hedefliyor
AMD, Taalas'ı satın alarak AI çip performansını artırmayı ve Nvidia'ya karşı rekabet etmeyi hedefliyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comPatlayıcı Gelen Talepler LLM Çıktı Sürelerini Hızlandırıyor
Patlayıcı yüklerin LLM çıktılarında beklenmedik hız artışı sağladığı keşfedildi.
Vektör İşlemcilerde İnferans için Çatı Hattı Sparse Tensör Kontraksiyonları
Ventaglio, vektör işlemcilerde seyrek tensör kontraksiyonlarını hızlandırarak performansı artırıyor.
LLM Trafiğini TCP Tarzı Congestion Kontrolü ile Yönlendirmek
Açık ağırlıklı çıkarım pazarında maliyet ve hız odaklı adaptif yönlendirici çözümü.
Kimi K3 ile LLM Çıkarımının Karlılığı: Hesaplamalar
Kimi K3 ile LLM çıkarımının karlılığı üzerine yapılan hesaplamalar ve analizler.
Kimi K3 için Day-0 API Geliştirdik
Baseten, Kimi K3 için Model API'lerinde day-0 desteği sağladı. Kimi K3, 2.8T parametre ile önceki açık modellerden çok daha büyük.
LLM Çıkarımına Giriş: Süreç ve Önemi
LLM çıkarım sürecini ve mühendislik açısından önemini keşfedin. Performans ve model yapısı hakkında detaylı bilgiler edinin.
RAI: Safir Rust ile CPU Tabanlı LLM Çıktı Motoru
RAI, Rust ile yazılmış CPU tabanlı bir LLM çıktı motorudur. GPU gerektirmeden yüksek performans sunar.