DeepSeek V4 Flash'ı AWS Spot Instance'larda Kendi Sunucularımızda Barındırıyoruz
DeepSeek V4 Flash'ın AWS spot GPU'larda kendi kendine barındırılması: MXFP4 kuantizasyon, RTX PRO 6000, DSpark ve KV cache optimizasyonu detayları.
Bir ekip, ücretsiz kullanım katmanını negatif kâr marjı olmadan sunabilmek için DeepSeek V4 Flash modelini AWS üzerinde kendi altyapılarında barındırmayı seçti. 284 milyar toplam parametreye sahip ama token başına yalnızca 13 milyar parametre aktif eden mixture-of-experts mimarisi, modeli girişimlerin karşılayabileceği donanımda çalıştırılabilir kılıyor. MXFP4 kuantizasyonu sayesinde disk boyutu 570GB'tan yaklaşık 150-160GB'a düşürülmüş; bu da NVIDIA Blackwell nesli RTX PRO 6000 GPU'larını (AWS g7e.24xlarge, 4x96GB) doğal seçenek haline getirmiş.
Mimari kararlar arasında ağırlıkların aynı bölgedeki S3'te tutulması öne çıkıyor: Spot instance'lar sık sık geri alındığından her yeniden başlatmada ~150GB ağırlık indirilmesi gerekiyor, bu yüzden makine imajına gömmek yerine değişmez bir S3 sürümü kullanılıyor. DSpark spekülatif decoding ile tek akışta saniyede ~300 token, toplu yükte ise saniyede ~3.000 token'a ulaşılıyor; bir kutu en fazla 64 eşzamanlı isteği kaldırabiliyor.
Ekibin vurguladığı en kritik nokta KV cache yönetimi. V4'ün dikkat mimarisi, eski geçmişi agresif biçimde sıkıştırıp son tokenlara ham çözünürlük ayırarak uzun ajan oturumlarının GPU belleğini tüketmesini engelliyor; üretimde bağlam penceresi 256K ile sınırlanıyor (model 1M destekliyor). Tüm kurulum açık kaynak olarak paylaşılmış durumda, bu da benzer donanımda model barındırmak isteyen mühendisler için somut bir referans sunuyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz