« Tüm yayınlar

Netflix Kendi LLM Sunum Altyapısını Nasıl Kurdu

Netflix'in vLLM, Triton ve OpenAI-uyumlu API ile kurduğu kendi LLM sunum altyapısının mimari kararları ve üretimde çıkan sorunlar.

Netflix, büyük dil modellerini barındırılan API'ler yerine kendi üretim ortamında, uçtan uca kendi altyapısıyla sunuyor. AI Platform ekibi, gRPC tabanlı JVM servis katmanı, Triton üzerinde çalışan Model Scoring Service (MSS) ve GPU/CPU model yönlendirmesinden oluşan mimariyi paylaştı.

Motor seçiminde TensorRT-LLM'den vLLM'e geçildi; gerekçe performans farkının kapanması ve embedding, prefill-only, otoregresif çözümleme gibi çeşitlenen iş yükleri için vLLM'in operasyonel esnekliği, hata ayıklama kolaylığı ve özel decoding kancaları oldu. Model paketleme tarafında Triton'un vLLM backend'i tercih edildi çünkü giriş/çıkış tensör şemalarını dondurmak yerine dağıtım anında dinamik üretiyor — bu da model ve frontend'in birbirinden bağımsız evrimleşmesini sağlıyor. Ancak Triton-vLLM sürüm uyumsuzlukları üretimde backend'in tamamen yüklenememesine yol açtığında, sürümlerin sabitlenmesi gerektiği ortaya çıktı.

API tarafında OpenAI-uyumlu arayüz gRPC'nin yanına eklendi; böylece barındırılan modelden ince ayarlı kendi modeline geçiş neredeyse kod değişikliği gerektirmiyor. Triton'un OpenAI frontend'i entegre edilirken response_format parametresinin sessizce düşürüldüğü, yani JSON çıktı isteyen çağrıların guided decoding olmadan hatalı JSON alabildiği fark edildi ve frontend yamalandı. Dağıtım tarafında Red-Black stratejisi, şema değişikliği gerektiren sürüm geçişlerinde eski isteklerin yeni dağıtıma gidip başarısız olmasına neden olan bir koordinasyon boşluğu ortaya çıkardı.