» Etiket
llm-inference
4 yayınDeepSeek V4 Flash'ı AWS Spot Instance'larda Kendi Sunucularımızda Barındırıyoruz
DeepSeek V4 Flash'ın AWS spot GPU'larda kendi kendine barındırılması: MXFP4 kuantizasyon, RTX PRO 6000, DSpark ve KV cache optimizasyonu detayları.
Headroom: Yerel AI için GPU bant genişliği tavanını tarayıcıda ölç
Headroom, WebGPU ile tarayıcıda GPU bellek bant genişliği tavanını ölçüp yerel AI tok/s performansını ve sürücü hatalarını gösteren açık araç.
Rastgele KV-Cache Tahliyesinde Doğrulanabilir Hata Sertifikaları
Rastgele Poisson örneklemeli KV-cache tahliyesi, LLM servislerinde %97 kapsamalı hata sertifikaları ve daha iyi hata atıflandırması sağlıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comBw24: RTX 50 Serisi Blackwell için Sıfırdan Rust+CUDA Çıkarım Motoru
Bw24, RTX 50 serisi Blackwell GPU'lar için sıfırdan yazılmış Rust+CUDA çıkarım motoru; spekülatif kod çözmede llama.cpp'ye karşı 2,3 kata varan hız sunuyor.