PXQ: ik_llama.cpp forku eski Tesla/Pascal GPU'larda +88% prefill kazandırıyor
ik_llama.cpp forku pxq_llama, yeni PXQ quant formatıyla Tesla P100/V100 ve 1080 Ti'de prefill ve decode hızını ciddi oranda artırıyor.
Bir geliştirici, ik_llama.cpp'yi çatallayıp pxq_llama adlı bir proje geliştirdi ve Pascal/Volta nesli (Tesla P100, V100, GTX 1080 Ti) gibi tensor-core öncesi GPU'lara özel PXQ adında yeni bir kuantizasyon formatı ile CUDA çekirdek seti sundu. 35B parametreli, 256 uzmanlı bir MoE modeliyle yapılan aynı donanım/aynı istem karşılaştırmasında pxq_llama, upstream ik_llama.cpp'ye karşı P100'de %88 prefill ve %30 decode, V100'de her iki metrikte %13, 1080 Ti'de ise %25 decode avantajı gösterdi; yalnızca 1080 Ti'deki bir prefill hücresinde upstream daha olgun çıktı ve bu açıkça belirtildi.
PXQ, MoE uzman tensörlerini öğrenilmiş bir codebook, 64 satırlık panellere yayılan fp16 çapa değerleri ve 16 elemanlık bloklar başına 4-bit alt-ölçek ile sıkıştırıyor; PXQ2/3/4 katmanları 2.27-4.27 bit/parametre arasında değişiyor. Üzerine gruplu MoE GEMM, K-split decode GEMV, gate/up+GLU füzyonu ve DeltaNet doğrusal dikkat füzyonu gibi Pascal/Volta'ya özel CUDA çekirdekleri ekleniyor. Yeni sürümde GTX 10-serisi için eklenen int8 dp4a prefill çekirdeği, 1080 Ti'de soğuk 5.8k token istemini 251'den 1001 t/s'ye çıkardı.
Geliştirici ayrıca genel geçer bir bulgu paylaşıyor: pre-Turing kartlarda flash-attention kapalıyken prefill, açıkken decode rejimi daha hızlı çalışıyor — bu her iki motor için de geçerli. Kontrol amaçlı, upstream'in kendi IQ_K quant'larını PXQ olmadan sadece çekirdek füzyonlarıyla çalıştırdığında decode'da %2.7-3.3 kazanç elde etmiş ve çıktı upstream ile bit-eş olmuş; yani kazanımlar gerçek format/çekirdek iyileştirmelerinden geliyor. Tüm bench script'leri, ham CSV'ler, sha doğrulamaları ve başarısız denemeler (ör. Pascal DMMV canlandırması %40 kayıp) MIT lisanslı depoda belgelenmiş.