NVIDIA ModelExpress: P2P RDMA ile Model Başlatma Saniyelere İniyor
NVIDIA ModelExpress, P2P GPU-to-GPU RDMA transferleriyle LLM ağırlık yüklemesini hızlandırıyor; model başlatma süresi dakikalardan saniyelere iniyor.
Büyük dil modeli checkpoint'leri artık yüzlerce gigabayttan bir terabayta kadar büyüyebiliyor ve modern servis mimarilerinde bu ağırlıklar sürekli taşınıyor: cold start'larda, otomatik ölçeklendirmede, rolling deployment'larda ve RL sonrası eğitimde trainer'dan rollout worker'lara aktarımlarda. Bu farklı senaryoların hepsi aynı bedeli ödüyor: GPU faydalı işe başlamadan önce harcanan veri taşıma süresi.
NVIDIA ModelExpress (MX), bir modeli yüklemeden önce uyumlu bir kopyanın başka bir serving replikasında zaten bulunup bulunmadığını kontrol ederek bu sorunu çözüyor. Uygun bir eş (peer) bulunduğunda, MX tensörleri NVIDIA Inference Xfer Library (NIXL) üzerinden P2P RDMA ile doğrudan GPU'dan GPU'ya aktarıyor; object storage, disk ve host memory tamamen devre dışı kalıyor. Uygun bir eş yoksa, MX en hızlı yoldan başlatma yapıyor: safetensors dosyalarını doğrudan object storage'dan GPU belleğine akıtıyor ya da GPUDirect Storage üzerinden diske hiç dokunmadan okuyor.
Pratikte MX, DeepSeek-V4 Pro ağırlıklarını ve JIT kernel cache'lerini replikalar arasında 10 saniyenin altında aktararak toplam başlatma süresini yaklaşık 8 dakikadan 1 dakika 44 saniyeye indirdi. Paylaşılan bir cache servisiyle kümedeki eşzamanlı indirmelerin tekilleştirilmesi ve NIXL bellek kaydı yükünün yüzde 99'a varan oranda azaltılması gibi ek optimizasyonlar, büyük modelleri ölçeklendirmenin maliyetini daha da düşürüyor.
Büyük ölçekli inference veya RL eğitim hatları işleten mühendisler için MX, ağırlık dağıtımını tekrarlayan bir cold-start cezasından, tek seferlik bir bootstrap ve ardından hızlı GPU-to-GPU yayılıma dönüştürüyor; bu da otomatik ölçeklendirme gecikmesini ve rollout senkronizasyon yükünü doğrudan azaltıyor.
Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz