« Tüm yayınlar

NVIDIA Exemplar Cloud: AI Kümelerinde %8-12 Performans Açığı Nasıl Kapanır?

NVIDIA'nın H100 ve GB200 NVL72 kümelerinde %8-12'lik AI eğitim performans açıklarını perf, Nsight Systems, SMMU ve NUMA ayarlarıyla nasıl çözdüğü.

NVIDIA'nın Exemplar Cloud doğrulama programı, partner AI kümelerinin referans mimariyle (RA) performans farkının %5'i aşmamasını şart koşuyor. Ancak aynı H100, GB200 NVL72 veya GB300 NVL72 donanımıyla kurulan gerçek dünya kümeleri sıklıkla %8-12 daha yavaş çalışıyor. NVIDIA mühendisleri bu farkın tek bir büyük arızadan değil, çekirdek, hipervizör, BIOS ve NCCL ayarlarındaki küçük yapılandırma hatalarının birikmesinden kaynaklandığını ortaya koydu.

İki vaka incelemesi tanı sürecini gözler önüne seriyor. DeepSeek-V3 MoE ön-eğitimi çalıştıran sanallaştırılmış bir GB200 NVL72 kümesinde, Nsight Systems ve Linux perf izleri CPU çevrimlerinin %24'ünün Arm SMMU komut kuyruğu geçersizleştirme çağrılarında harcandığını gösterdi; bunun nedeni sık misafir bellek eşlemelerinde oluşan seri VM çıkışlarıydı. Host çekirdeğinde ve hipervizörde Virtual Command Queue (VCMDQ) desteğinin etkinleştirilmesi bu seri işlemi ortadan kaldırarak %12-14'lük iterasyon süresi farkını kapattı. Llama 3 70B çalıştıran bir H100 SXM5 kümesinde ise turbostat ve numastat, BIOS C-state ayarlarının C1'de kilitli kalarak turbo frekans marjını kısıtladığını ve hipervizör iş parçacıklarının veri yükleyici süreçleriyle aynı fiziksel çekirdekleri paylaştığını, bunun da NUMA-uzak bellek erişimi gecikmelerine yol açtığını ortaya çıkardı; C-state politikasının düzeltilmesi ve cpuset izolasyonu %12'lik açığın büyük kısmını kapattı.

Altyapı mühendisleri için çıkarılacak ders, bu farkları kapatmanın donanım eşdeğerliğinin yazılım eşdeğerliği garanti ettiğini varsaymak yerine SMMU, CPU güç durumları, süreç yakınlığı ve NCCL fabric ayarlarını katman katman profillemeyi gerektirdiğidir.