« Tüm yayınlar

Tek MI300X GPU'da DeepSeek V4 Flash: Gerçek Kodlama Ajanı Testi

Tek AMD MI300X GPU'da DeepSeek V4 Flash'ın gerçek kodlama ajanlarıyla ölçülen throughput, cache isabet oranı ve maliyet analizi.

Bir mühendis, sentetik benchmark yükü yerine gerçek açık kaynak depolarında çalışan otonom kodlama ajanlarıyla tek bir AMD MI300X GPU'nun DeepSeek V4 Flash üzerinde ne kadar iş çıkarabildiğini ölçtü. vLLM tabanlı açık kaynak bir serving stack'i kullanılarak yapılan testte, tek GPU'nun 32 eşzamanlı ajanı sorunsuz şekilde besleyebildiği, bunun ötesinde ise performansın kademeli değil ani bir çöküşle bittiği ortaya çıktı.

32 ajanlık ayarlanmış (tuned) pencerede saniyede 582 token üretim ve 78.3K token prompt işleme hızına ulaşıldı; prefix cache isabet oranı ise %93 ile sistemin taşıyıcı metriği oldu, çünkü ajanların her turda büyüyen konuşma geçmişini yeniden göndermesi ancak agresif önbellekleme sayesinde sürdürülebilir hale geliyor. AITER GEMM ayarlaması, scheduler ve kernel eşleşme düzeltmeleriyle birlikte %18'lik ek verim kazandırdı.

Maliyet tarafında, saatlik 2 dolarlık kiralama ücretiyle üretilen her 1M token 0.95 dolara, önbellekten sunulan prompt token'ları ise pratik olarak neredeyse bedavaya geliyor. Ancak 48 ajana çıkıldığında GPU'nun KV önbelleği taşıyor, isabet oranı %30'un altına düşüyor ve verim kademeli değil çöküyor — bu da kapasite planlamasının kuyruğa değil önbellek boyutuna göre yapılması gerektiğini gösteriyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz