« Tüm yayınlar

Netflix, LLM Sunumunu vLLM ve Triton ile Tamamen İçeride Kuruyor

Netflix'in vLLM, Triton ve OpenAI uyumlu API ile kendi LLM sunum altyapısını nasıl kurduğuna dair mühendislik kararları ve üretim dersleri.

Netflix, çoğu şirketin aksine LLM'leri barındırılan API'ler üzerinden tüketmek yerine tüm sunum altyapısını -model dağıtımından çıkarıma kadar- kendi üretim ortamında çalıştırıyor. Ekip, JVM tabanlı birleşik bir servis katmanı üzerine kurulu mimarisini; motor seçimi, model paketleme, API tasarımı ve dağıtım stratejisi gibi kritik kararlar üzerinden anlatıyor. Sistem, gRPC ve HTTP olmak üzere iki farklı giriş yolunu destekliyor; büyük modeller Triton tabanlı Model Scoring Service üzerinden GPU'larda çalışıyor.

Platform başlangıçta TensorRT-LLM ile inşa edilmiş, ancak 2025 yazına gelindiğinde açık kaynak motorların performans farkını kapatması ve iş yükünün embedding, prefill-only çıkarım ve özel kısıtlı decode mantığı gibi çeşitli senaryolara genişlemesiyle vLLM'e geçilmiş. Triton içinde model paketlemek için Python backend yerine vLLM backend'i tercih edilmiş; bu da model artefaktlarının frontend güncellemelerinden bağımsız kalmasını sağlıyor, ancak Triton ve vLLM sürüm uyumsuzlukları üretimde ciddi arıza kaynağı olmuş.

Ekip ayrıca OpenAI uyumlu API'yi gRPC'nin yanına ikinci bir arayüz olarak eklemiş; böylece barındırılan modelden kendi barındırdıkları ince ayarlı modele geçiş neredeyse sorunsuz hale gelmiş. Triton'ın OpenAI uyumlu frontend'inde response_format parametresinin sessizce göz ardı edildiği tespit edilmiş ve bu, guided decoding kısıtlarının uygulanmamasına yol açtığından frontend yamanmış. Son olarak, red-black dağıtım stratejisinin şema değişikliği gerektiren güncellemelerde koordinasyon sorunlarına yol açabildiği üretimde ortaya çıkmış.