» Etiket
inference
4 yayınNVIDIA ModelExpress: P2P RDMA ile Model Başlatma Saniyelere İniyor
NVIDIA ModelExpress, P2P GPU-to-GPU RDMA transferleriyle LLM ağırlık yüklemesini hızlandırıyor; model başlatma süresi dakikalardan saniyelere iniyor.
2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı
Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.
Ninfer: Tek GPU ile yüksek performanslı çıkarım
NInfer, RTX 5090 üzerinde yüksek performanslı çıkarım için C++/CUDA motoru sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comKimi K3 için Day-0 API Geliştirdik
Baseten, Kimi K3 için Model API'lerinde day-0 desteği sağladı. Kimi K3, 2.8T parametre ile önceki açık modellerden çok daha büyük.