» Etiket
quantization
23 yayın397B Parametreli MoE Modeli Tek RTX PRO 6000 96GB GPU'da Çalıştı
Krasis çalışma zamanı, 397B parametreli MoE modelini tek RTX PRO 6000 96GB GPU'da 2.354 tok/s prefill hızıyla çalıştırdı.
CPU'da LLM: hız kazandıran kuantizasyon değil, metin formatı
Ücretsiz ARM CPU sunucusunda ölçüldü: prompt'u 'etiket: değer' formatına çevirmek LLM prefill süresini 6,5 kat kısalttı, kuantizasyon hileleri doğruluğu düşürdü.
56M parametreli LLM, ESP-NOW ile 3 ESP32-S3 kartına dağıtıldı
56M parametreli LLM, ESP-NOW üzerinden üç ESP32-S3 kartına dağıtılarak çalıştırıldı; Split-PLE ve KV cache ile tutarlılık artırıldı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com2.8 Trilyon Parametreli Kimi K3, 64GB M1 Mac'te Çalıştırıldı
Deltafin, 2.8 trilyon parametreli Kimi K3 MoE modelini 64GB'lık M1 Mac'te, tam kurulum veya akış modu ile çalıştırıyor.
DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı
AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.
Tesla P100'ün llama.cpp'deki yıllık FP16 hatası 3 satırla çözüldü
llama.cpp'deki 3 satırlık CUDA yaması, Tesla P100'ün yıllardır süren gizli FP16 hassasiyet hatasını performans kaybı olmadan gideriyor.
2.8 Trilyon Parametreli Kimi K3, GPU'suz Mini PC'de Çalıştırıldı
Moonshot'un 2.8T parametreli açık ağırlıklı Kimi K3 modeli, disk üzerinden uzman akışı ile GPU'suz mini PC'de çalıştırıldı.
PXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta
Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.
llama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.