« Tüm yayınlar

DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395'te 32 tok/s'a ulaştı

AMD Ryzen AI MAX+ 395'te 284B parametreli DeepSeek V4 Flash, 128GB birleşik bellekle 32 tok/s decode ve ~250 tok/s seyrek prefill hızına ulaştı.

Lucebox projesi, 284 milyar parametreli DeepSeek V4 Flash mixture-of-experts modelini AMD Ryzen AI MAX+ 395 APU üzerinde, 128 GB birleşik LPDDR5X bellek kullanarak tamamen yerel olarak çalıştırdı. Ayrı bir GPU veya uzak çıkarım servisi olmadan, decode aşamasında 32.0 tok/s ve indeksli seyrek prefill ile yaklaşık 250 tok/s elde edildi. Sonuçlar, LocalMaxxing platformundaki aynı donanım sınıfındaki en yakın rakip HipFire'ı (18.99 tok/s) yüzde 68.5 geride bıraktı ve önceki en iyi sonuç DwarfStar'ın (15.6 tok/s) 2.05 katına ulaştı.

Bu performansın anahtarı, ROCmFPX adı verilen ve AMD'nin ROCm/HIP yol haritasına özgü blok tabanlı kuantizasyon ailesi. Model, en büyük yönlendirilmiş uzman matrisleri için 2 bit, projeksiyonlar için 3.5 bit ve daha hassas katmanlar için 4.25 bit kullanan karma hassasiyetli bir tarif ile 102.3 GB'a sıkıştırıldı; bu da parametre başına ortalama 2.88 bite denk geliyor. DSpark adlı küçük bir taslak model, spekülatif kod çözme yaparak ana modelin tek geçişte birden fazla token doğrulamasını sağlıyor ve bu da autoregressive moda göre yüzde 26.4 hız kazancı getiriyor.

Mühendisler için önemi, tüketici sınıfı bir APU'da 284B parametrelik bir modelin ikinci bir makine veya bulut GPU'suna ihtiyaç duymadan pratik hızlarda çalışabildiğini göstermesi. Kod Lucebox ana dalında herkese açık ve yeniden üretilebilir; ancak seyrek prefill modunun kayan nokta indirgeme sırasını değiştirdiği ve dörtlü uzman seçiminin varsayılan altılı yerine kalite marjından ödün verdiği belirtiliyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz