» Etiket
quantization
7 yayın397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı
Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.
CPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
56M parametreli LLM, ESP-NOW ile 3 ESP32-S3 kartına dağıtıldı
56M parametreli LLM, ESP-NOW üzerinden üç ESP32-S3 kartına dağıtılarak çalıştırıldı; Split-PLE ve KV cache ile tutarlılık artırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com2.8 Trilyon Parametreli Kimi K3, 64GB M1 Mac'te Çalıştırıldı
Deltafin, 2.8 trilyon parametreli Kimi K3 MoE modelini 64GB'lık M1 Mac'te, tam kurulum veya akış modu ile çalıştırıyor.
DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı
AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.
2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı
Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.
Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.