« Tüm yayınlar

Llama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı

Llama.cpp'daki yeni PR, Q2_0'ı x86 CPU'larda 3.0–3.6 kat hızlandırıyor. Detaylar burada.

Llama.cpp'daki #26348 numaralı PR, Q2_0 × Q8_0 nokta çarpımı için x86 VNNI uygulaması ekleyerek önemli bir hız artışı sağladı. AMD EPYC 9645 üzerinde yapılan testlerde, 1.7B ila 27B Bonsai modelleri arasında 3–3.6 kat daha yüksek bir verim elde edildi. Bu gelişme, özellikle Intel'in 12. ve 14. nesil işlemcilerinde VNNI yolunun eksik olmasıyla ilgili önemli sonuçlar doğuruyor.