» Etiket
quantization
3 yayınPXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
llama.cpp'ye Kayıpsız F32 Sıkıştırma: QFX32/QFX16 ile 2.05x Küçülme
llama.cpp'ye eklenen QFX32/QFX16 GGUF tipleri, F32 modelleri doğruluk kaybı olmadan 2.05x sıkıştırıyor; teknik detaylar ve kullanım.
Quantprobe: 16 GB RAM'lik Eski PC'de 110B Parametreli LLM Çalıştırma
Quantprobe aracı, 2016 model bir PC'de 110B parametreli LLM'i 16GB RAM ve SATA SSD ile çalıştırmanın ölçümle kanıtlanmış yöntemini gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com