« Tüm yayınlar

Nunchaku'nun 4-bit Difüzyon Çıkarımı Artık Diffusers'ta

Nunchaku'nun 4-bit SVDQuant kuantizasyonu artık Diffusers'a native entegre; ayrı motor veya derleme gerekmeden from_pretrained ile yüklenebiliyor.

Hugging Face, SVDQuant tabanlı Nunchaku motorunun 4-bit ağırlık ve aktivasyon (W4A4) kuantizasyonunu 'Nunchaku Lite' adıyla Diffusers kütüphanesine doğrudan entegre etti. Artık önceden kuantize edilmiş bir kontrol noktası, ayrı bir çıkarım motoru veya yerel CUDA derlemesi gerekmeden standart from_pretrained() çağrısıyla yüklenebiliyor; gerekli CUDA çekirdekleri kernels paketi üzerinden Hub'dan otomatik indiriliyor.

Nunchaku Lite, transformer'ın dikkat ve MLP katmanlarında svdq_w4a4 (NVFP4/INT4), normalizasyon ve modülasyon katmanlarında ise awq_w4a16 çalışma zamanı katmanlarını modelin mevcut nn.Linear modüllerine yamalayarak çalışıyor. Bu sayede model mimarisi bozulmadan LoRA yükleme, offloading ve torch.compile gibi Diffusers özellikleri sorunsuz çalışmaya devam ediyor.

Mimariye özel füzyon çekirdekleri olmadığı için orijinal Nunchaku'nun hızına tam olarak ulaşılamasa da, VRAM tasarrufu korunurken yaklaşık %30'luk bir hızlanma elde ediliyor; torch.compile ile bu oran 1.8x'e kadar çıkabiliyor. RTX 5090 üzerinde 1024x1024 bir görsel yaklaşık 1.7 saniyede ve 12 GB bellekle üretilebiliyor, BF16'da ise bu değer 24 GB'a çıkıyor. Ayrıca diffuse-compressor araç seti ile geliştiriciler kendi mimarilerini kuantize edip standart Diffusers deposu olarak yayınlayabiliyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz