« Tüm yayınlar

Warner Chappell, AI Embedding'lerle Bulut Maliyetini Yarıya İndirdi

Warner Chappell, SQL tabanlı eşleştirme sistemini AI vektör embedding'lerine taşıyarak bulut maliyetini %50 azaltıp eşleştirme oranını %65 artırdı.

Warner Chappell Music'in Global Match sistemi, streaming platformlarından gelen milyonlarca satırlık CSV dosyalarında yayıncılık kataloğunu tespit etmek için uzun süre Snowflake üzerinde brute-force SQL string-eşleştirmesi kullanıyordu. Bu yaklaşım yazım hatalarına, eksik karakterlere ve transliterasyon farklarına karşı kırılgandı; artan veri hacmiyle birlikte hem işlem süreleri (bir batch için 12+ saat) hem de bulut maliyetleri kontrolden çıkmıştı.

Ekip, veritabanı katmanındaki ağır işlemi tamamen terk ederek BERT tabanlı embedding modelleriyle ~2 milyon kayıtlık kataloğu vektör uzayına taşıdı. Olay tetiklemeli (event-driven) bir mimariyle AWS Lambda ve SQS kullanılarak dosyalar parçalara ayrılıp paralel işleniyor; scikit-learn'ün K-En Yakın Komşu aramasıyla milisaniyeler içinde en iyi adaylar bulunuyor. Sonuçta anlamsal benzerlik, katı string eşleşmesinin yakalayamadığı yazım farklarını ve varyasyonları geometrik yakınlık olarak yakalayabiliyor.

Sonuç: bulut maliyetlerinde %50'nin üzerinde düşüş, işlem hızında 100 kattan fazla artış ve toplam eşleştirme oranında %65'lik iyileşme. Yeni mimari ayrıca operasyon ekiplerinin manuel incelemesini hızlandıran ve düzeltmelerin modele geri beslendiği bir insan-döngüde iyileştirme akışı da mümkün kıldı. Mühendisler için asıl ders net: ölçek büyüdükçe daha büyük altyapıya yatırım yapmak yerine, önce problemin temel matematiğini ve algoritmik yaklaşımını sorgulamak çok daha büyük kazanımlar sağlayabilir.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz