« Tüm yayınlar

llama.cpp CPU Yükleme Optimizasyonları

llama.cpp için CPU yükleme optimizasyonları: CUDA grafiklerini devre dışı bırakın ve FFN alt katmanlarını CPU'ya yönlendirin.

llama.cpp için yapılan testlerde, CUDA grafikleri devre dışı bırakıldığında CPU yüklemesi daha verimli hale geliyor. Önerilen yöntem, FFN alt katmanlarını CPU'ya yönlendirmek için --override-tensor kullanmak. Bu sayede PCIe trafiği azalırken, GPU üzerindeki dikkat ve KV işlemleri korunuyor. Kullanıcılar, belirli katmanları hedefleyerek daha az veri transferi ile daha iyi performans elde edebilirler.